GPT-6 Astra x V2Fun - 从代码生成到模型协作
了解 GPT-6 Astra 和 V2Fun 如何结合智能体推理、代码生成与 AI 3D 基础模型,构建复杂的结构化 3D 资产。

GPT-6 Astra × V2Fun:从代码生成到模型协作
想象这样一个 3D 建模流程。
你向 GPT-6 Astra 提供一张挖掘机参考图。它首先识别机器的组成部分:驾驶室、履带、底盘、动臂、斗杆、铲斗等。
随后,这些主要部件会被分别发送给专门的 3D 生成模型,并在几十秒内以独立资产的形式返回。
接下来,GPT-6 Astra 接管流程。
它确定每个部件的比例和空间关系,将履带放置在底盘两侧,把动臂连接到机身上,然后依次连接斗杆和铲斗。主体结构完成后,它使用 Three.js 添加液压管线、螺丝、转轴,甚至驾驶室内的操纵杆。
最终,一个完整、结构化且可编辑的挖掘机出现在 3D 场景中。
这不只是图像转 3D,也不只是代码生成。
这是两种 AI 能力开始以更自然的方式协同工作:
GPT-6 Astra 负责理解、规划和构建,而专门的 3D 基础模型负责处理复杂几何。
这是 Vertex Lab 旗下产品 V2Fun 最近正在探索的一种新工作流。
其背后,是一个更广泛的转变:
3D 智能体正在从“自己生成一切”,转向“知道该调用哪个模型,以及何时调用”。
01
转折点
GPT-6 Astra 已经能够进行 3D 构建。接下来会怎样?
GPT-6 Astra 带来的一个重大变化,是大型语言模型真正开始进入三维世界。
过去,我们更习惯于让 AI 生成图像、视频或一段文字。如今,凭借不断增强的多模态理解、空间推理和编程能力,GPT-6 Astra 可以理解 3D 物体的结构,并通过 Three.js 等程序化方法真正将其构建出来。
以工业生产线为例。
GPT-6 Astra 可以识别其中的传送带、滚筒、支撑框架、电机和工作站,然后逐步生成相应的几何体。
这些物体非常适合程序化建模,因为它们通常具有清晰的数学关系和重复结构。支撑柱可以用基础几何形状表示,滚筒可以复制几十次,而传送带的长度和位置则可以直接通过参数控制。
更重要的是,最终结果并不是一个完全不透明的网格。
生产线中的每个部件仍然是独立对象,可以继续移动、复制、删除或修改。
从这个角度来看,GPT-6 Astra 做的不只是“生成 3D”。它开始具备一种更接近 3D 工程师的能力:
理解一个物体由什么组成,并将它构建出来。
但随着物体变得更加复杂,一个新的问题出现了。
如果物体不是生产线,而是一张人脸、一只生物、一件服装、一座雕塑,甚至是一台拥有复杂工业表面的挖掘机呢?GPT-6 Astra 是否还应该用代码写出全部几何结构?
答案也许不是非此即彼。
而这正是 V2Fun 可以进入工作流的地方。
02
为什么是 V2Fun
为什么是 V2Fun?
V2Fun 并不是为了这次演示临时接入的一个 3D API。
它是 Vertex Lab 长期开展 AI 3D 基础模型研发的产品平台。
Vertex Lab 成立于 2025 年,始终专注于 3D 生成、空间智能,并在更长期的方向上探索世界模型基础设施。
此前,V2Fun 在 HDC 2026 上首次亮相,成为 HarmonyOS 首个由 3D 基础模型驱动的 AI 原生应用。它的移动端应用和 Web 工作空间覆盖从日常创作到专业 3D 内容生产的完整流程。
从一开始,它关注的始终是同一个问题:
如何以更少的工作量和更短的时间,将一个复杂的三维物体转化为可用的 3D 资产?
即将推出的 V2Fun 2.0 将进一步拓展这些能力。
新版本将搭载新一代 3D 基础模型,并支持最高 8K 分辨率的纹理生成。它将重点提升复杂几何、人类角色、生物、服装、雕塑及其他不规则表面的生成质量。
这正是 V2Fun 与 GPT-6 Astra 的结合不只是一场偶然的产品合作的原因。
它们擅长解决的问题,本质上具有互补性。
GPT-6 Astra 擅长理解、规划、空间关系、编程和智能体编排。
V2Fun 擅长直接生成复杂的 3D 几何和高质量表面。
一个更擅长回答:
“这个物体应该如何构建?”
另一个更擅长回答:
“这个复杂部件实际上应该是什么样子?”
当这两种能力结合起来后,3D 生成就不再局限于单一方法。
03
挑战
有些东西最适合用代码构建,另一些则更适合直接生成。
让我们回到那台挖掘机。
从结构上看,它具有高度规律性。
GPT-6 Astra 可以轻松理解挖掘机由底盘、左右履带、机身、驾驶室、动臂、斗杆和铲斗组成,也能理解这些部件之间应该如何连接。
但仔细观察后,问题就变了。
驾驶室不是一个简单的立方体,机身外壳也无法通过组合几个基础几何体来准确表示。铲斗具有连续的曲面,机械臂拥有复杂的轮廓,而履带和底盘则包含大量工业设计细节。
GPT-6 Astra 当然可以继续用程序化代码来近似这些结构。
但几何越复杂,需要生成和修改的代码就越多,所需的迭代次数也越多。
对于智能体而言,这意味着要花费越来越多的 token 来描述底层几何。
因此,我们尝试了另一种方法。
GPT-6 Astra 首先“理解”挖掘机。
然后,它将驾驶室、履带、机械臂和铲斗等复杂的主要部件,分别交给 V2Fun 2.0 生成。
生成完成后,GPT-6 Astra 再次接管流程,调整比例、旋转和位置,并组装出完整物体。
在这里,V2Fun 带来了它一直在发展的核心能力:
直接根据视觉输入重建复杂的 3D 结构,而不是让语言模型通过大量代码间接描述表面。
这看起来可能只是少写了一些 Three.js,但实际上,它改变了整个计算方式。
更有意思的是,V2Fun 并不会取代 Three.js。
组装完成后,GPT-6 Astra 仍然会自行生成许多元素。
例如液压管线。
液压管线本质上是一种连接几个关键点的管状结构,非常适合程序化建模。
螺丝、连接轴和操纵杆也是如此。
这些物体具有规律的尺寸和简单的结构,而且通常会大量出现。如果每一个都单独调用 3D 基础模型,反而会增加工作流的成本和复杂度。
因此,最终的挖掘机是真正的混合资产。
V2Fun 生成复杂的主要部件。
GPT-6 Astra + Three.js 负责规律性的细节。
随后,GPT-6 Astra 将两者组织成一个结构化的 3D 物体。
这正是这种方法令人信服的地方:
智能体不是在代码生成和 3D 基础模型之间二选一,而是为每个部件决定最适合的能力。
04
更加复杂
面对人类角色时,V2Fun 的价值会更加明显
挖掘机仍然主要是一个硬表面物体。
真正将纯程序化方法推向极限的,是人类角色和复杂的有机表面。
为了探索这一点,我们制作了一个更具挑战性的演示:
让 GPT-6 Astra 构建一位全副武装、身穿铠甲的国王。
除了人体本身,这个角色还包括精细的铠甲、头部、剑和盾牌。
与机械设备相比,人类角色更难通过规则表达。
一张脸是否“看起来正确”,取决于的不只是将眼睛、鼻子和嘴巴大致放在正确位置。
脸部形状、颧骨、眼窝、鼻梁、嘴唇,以及它们之间细微且连续的曲率变化,共同决定了最终外观。
铠甲也是如此。
虽然它属于硬表面物体,但并不是一个简单的工程部件。浮雕、装饰、连续表面和风格化形态,共同构成了角色的视觉特征。
这些正是 V2Fun 2.0 下一代 3D 基础模型更擅长处理的对象。
在这个演示中,GPT-6 Astra 首先理解整个角色,并将其拆分为几个主要部分:头部、身体与铠甲、剑和盾牌。
随后,V2Fun 分别生成这些复杂部件。
接下来由 GPT-6 Astra 负责:
头部的比例是否正确?它应该如何与身体连接?剑和盾牌应该放在哪里?各个部件的比例是否一致?哪些模型需要进行多边形简化?以及如何将所有内容组织成一个可编辑、可继续使用的 3D 资产?
换句话说:
V2Fun 解决的是“如何快速、高质量地生成复杂几何”。
GPT-6 Astra 解决的是“如何将这些几何体变成一个完整物体”。
为什么 V2Fun 能够处理这一层面的复杂几何?
原因不只是“它也是一个图像转 3D 模型”。
Vertex Lab 近期的核心研发主要聚焦于两个基本问题:
如何更准确地表示几何,以及如何让 高分辨率 纹理在 3D 表面上保持一致。
在几何方面,团队持续优化 3D 表示方式和生成架构,致力于减少低效的几何表示,并将模型容量集中于高曲率区域、薄结构和复杂区域。
在纹理方面,重点是解决高分辨率、多视角生成中经常出现的错位、撕裂和细节丢失问题。
这也支撑了 V2Fun 2.0 生成最高 8K 分辨率高质量纹理的能力。
对于智能体而言,这类能力非常重要。
它调用的是能够产出真实 3D 资产的专用模型,而不是一个只能生成“看起来像 3D”内容的视觉生成工具。
生成的资产仍然需要由 GPT-6 Astra 进行组装、降低多边形数量和修改,并最终可能进入动画、游戏、3D 打印或其他 3D 工作流。
这正是 V2Fun 一直致力于解决的产品挑战:
确保 AI 生成的不只是一次性结果,而是真正可以被人们继续使用和编辑的 3D 资产。
05
效率
除了更高质量,还有另一个变化:token
这种工作流还带来了一个非常直接的好处:
Token 效率。
当 GPT-6 Astra 使用 Three.js 描述简单结构时,token 的使用效率非常高。
一个圆柱体、一条液压管线或几颗螺丝,只需要很少的代码。
但如果用同样的方法去近似人脸、布料褶皱或高度复杂的工业表面,需要生成和修改的几何代码量就会迅速增加。
大量 token 随后会被花费在这样的问题上:
“怎样才能让这个表面更准确一点?”
“这个轮廓应该如何进一步调整?”
“这里应该添加多少几何细节?”
当复杂部件直接交给 V2Fun 时,这些底层过程就会被压缩为一次对专用模型的调用。
GPT-6 Astra 可以将更多推理资源用于真正需要推理的决策:
如何拆解物体;
哪些部件应该分别生成;
各个部件在空间中的关系;
如何组装最终物体;
哪些地方还需要进一步修改。
这就是 V2Fun 2.0 不只是提供“外观更好的模型”的原因。
对于复杂的 3D 任务,它还有望同时减少 GPT-6 Astra 的 token 消耗和整体建模时间。
过去的工作流可能是:
理解 → 编写几何代码 → 修改 → 编写更多几何代码 → 再次修改
现在则变成:
理解 → 拆分部件 → 并行生成 → 组装 → 添加局部细节
当多个复杂部件可以同时生成时,这种效率优势还会进一步扩大。
06
结语
从生成一个模型,到成为智能体的核心 3D 能力
过去几年,AI 3D 领域的核心问题一直是:
如何生成更好的模型?
但随着 GPT-6 Astra 这样的模型获得更强的多模态理解、编程和智能体能力,这个问题正在发生变化。
未来,AI 可能不需要为每一项 3D 任务都使用同一种技术。
简单结构可以直接通过代码构建。
复杂表面可以交给 V2Fun。
现有资产可以直接复用。
多边形简化、组装和结构调整,则可以重新交还给智能体。
这与 3D 生成行业从一次性生成工具转向智能体驱动生产力的趋势一致。参考文章描述了同样的变化:3D 生成正从类似早期聊天机器人的阶段,迈向由智能体驱动的生产力阶段。
对于 Vertex Lab 而言,这一方向与其长期技术愿景一致。
从一开始,公司就从未将 V2Fun 定义为一个单纯的“图像转 3D 网站”。
从让移动端的 3D 创作更加普及,到在 Web 端支持专业资产生产,再到 3D 模型、动画、动作,以及更长期的空间智能和世界模型探索,Vertex Lab 始终致力于构建 3D 内容生成与空间智能基础设施。
智能体的崛起,可能会为这一目标打开一条新路径。
未来,用户可能不需要知道应该调用哪个模型、要写什么代码,或选择哪种建模方式。
他们可能只需要说:
“把这个变成 3D。”
GPT-6 Astra 会理解请求,并决定如何执行。
V2Fun 2.0 旨在成为 GPT-6 Astra 面向复杂三维世界所依赖的专用能力。
GPT-6 Astra 负责理解、规划和构建。
V2Fun 将复杂的三维创意转化为真实资产。
GPT-6 Astra × V2Fun:从代码生成到模型协作。
06
结语
从生成一个模型,到成为智能体的核心 3D 能力
过去几年,AI 3D 领域的核心问题一直是:
如何生成更好的模型?
但随着 GPT-6 Astra 这样的模型获得更强的多模态理解、编程和智能体能力,这个问题正在发生变化。
未来,AI 可能不需要为每一项 3D 任务都使用同一种技术。
简单结构可以直接通过代码构建。
复杂表面可以交给 V2Fun。
现有资产可以直接复用。
多边形简化、组装和结构调整,则可以重新交还给智能体。
这与 3D 生成行业从一次性生成工具转向智能体驱动生产力的趋势一致。参考文章描述了同样的变化:3D 生成正从类似早期聊天机器人的阶段,迈向由智能体驱动的生产力阶段。
对于 Vertex Lab 而言,这一方向与其长期技术愿景一致。
从一开始,公司就从未将 V2Fun 定义为一个单纯的“图像转 3D 网站”。
从让移动端的 3D 创作更加普及,到在 Web 端支持专业资产生产,再到 3D 模型、动画、动作,以及更长期的空间智能和世界模型探索,Vertex Lab 始终致力于构建 3D 内容生成与空间智能基础设施。
智能体的崛起,可能会为这一目标打开一条新路径。
未来,用户可能不需要知道应该调用哪个模型、要写什么代码,或选择哪种建模方式。
他们可能只需要说:
“把这个变成 3D。”
GPT-6 Astra 会理解请求,并决定如何执行。
V2Fun 2.0 旨在成为 GPT-6 Astra 面向复杂三维世界所依赖的专用能力。
GPT-6 Astra 负责理解、规划和构建。
V2Fun 将复杂的三维创意转化为真实资产。
GPT-6 Astra × V2Fun:从代码生成到模型协作。
FAQ
Can GPT-6 Astra generate 3D models?
GPT-6 Astra can support 3D creation by reasoning about scenes, planning asset structure, and generating code. For complex geometry, it can work with V2Fun’s 3D foundation models to generate detailed 3D assets.
How does GPT-6 Astra work with V2Fun for 3D generation?
GPT-6 Astra handles reasoning, planning, code generation, and scene assembly, while V2Fun generates complex 3D geometry. Together, they enable an agent-driven workflow for creating structured 3D scenes.
What is a 3D AI agent?
A 3D AI agent is an AI system that can understand a 3D creation task, plan the required steps, generate or retrieve assets, and assemble them into a complete scene with less manual intervention.
Why use V2Fun instead of generating 3D geometry directly with code?
Code works well for simple procedural geometry, but complex organic or detailed assets are harder to create this way. V2Fun’s 3D foundation models are designed to generate these more complex 3D assets from references or prompts.
Can GPT-6 Astra and V2Fun create 3D models from images?
Yes. In the workflow described here, GPT-6 Astra can analyze a reference image and identify the required assets, while V2Fun can generate complex 3D geometry based on those references.
What can GPT-6 Astra and V2Fun be used to create?
The combined workflow can support complex 3D scenes containing multiple assets, including environments, objects, characters, creatures, and other geometry that would be difficult to generate through code alone.



