GPT-6 Astra x V2Fun - 從程式碼生成到模型協作
了解 GPT-6 Astra 與 V2Fun 如何結合代理推理、程式碼生成與 AI 3D 基礎模型,打造複雜且具結構的 3D 資產。
GPT-6 Astra × V2Fun:從程式碼生成到模型 協作
想像一下這樣的 3D 建模流程。
你給 GPT-6 Astra 一張挖土機的參考圖片。它首先辨識機器的各個組件:駕駛室、履帶、底盤、動臂、斗桿、鏟斗等。
接著,這些主要組件會分別傳送給專門的 3D 生成模型,並在幾十秒內以獨立資產的形式返回。
下一步,由 GPT-6 Astra 接手。
它會判斷每個零件的比例與空間關係,將履帶放置在底盤兩側,把動臂連接到機身,再依序接上斗桿與鏟斗。完成主體結構後,它會使用 Three.js 加入液壓管、螺絲、樞軸,甚至是駕駛室內的操縱桿。
最後,一台完整、結構清晰且可編輯的挖土機出現在 3D 場景中。
這不只是單純的圖像轉 3D,也不只是單純的程式碼生成。
而是兩種 AI 能力開始以更自然的方式協同工作:
GPT-6 Astra 負責理解、規劃與建構,而專門的 3D 基礎模型負責處理複雜幾何。
這正是 Vertex Lab 旗下產品 V2Fun 最近開始探索的新工作流程。
其背後代表著更廣泛的轉變:
3D 智慧體正從「自行生成一切」轉向「知道該呼叫哪個模型,以及何時呼叫」。

01
轉捩點
GPT-6 Astra 已經能夠建構 3D 物件。接下來呢?
GPT-6 Astra 帶來的一項重大變化,是大型語言模型真正開始進入三維世界。
過去,我們更習慣要求 AI 生成圖片、影片或文字。如今,憑藉越來越強的多模態理解、空間推理與程式設計能力,GPT-6 Astra 能理解 3D 物件的結構,並透過 Three.js 等程序化方法實際將其建構出來。
以工業生產線為例。
GPT-6 Astra 可以辨識其中的輸送帶、滾輪、支撐框架、馬達與工作站,然後逐步生成相應的幾何結構。
這些物件非常適合程序化建模,因為它們通常具有清晰的數學關係與重複結構。支撐柱可以用基本幾何形狀表示,滾輪可以複製數十次,而輸送帶的長度與位置則能直接透過參數控制。
更重要的是,結果並不是完全不透明的網格。
生產線中的每個組件仍然是獨立物件,可以移動、複製、刪除或修改。
從這個角度來看,GPT-6 Astra 所做的不只是「生成 3D」。它開始發展出更接近 3D 工程師的能力:
理解物件由什麼構成,並將其建構出來。

但當物件變得更加複雜時,一個新的問題浮現了。
如果物件不是生產線,而是人臉、生物、服裝、雕塑,甚至是具有複雜工業表面的挖土機呢?GPT-6 Astra 是否仍然應該用程式碼寫出全部幾何結構?
答案可能不是非此即彼。
而這正是 V2Fun 能夠加入工作流程的地方。
02
為什麼是 V2FUN
為什麼是 V2Fun?
V2Fun 並不是為了這次展示臨時加入的 3D API。
它是 Vertex Lab 長期研究與開發 AI 3D 基礎模型的產品平台。
Vertex Lab 成立於 2025 年,始終專注於 3D 生成、空間智慧,以及更長期的世界模型基礎設施。
V2Fun 此前曾在 HDC 2026 上亮相,成為 HarmonyOS 首款由 3D 基礎模型驅動的 AI 原生應用。其行動應用程式與網頁工作區涵蓋從日常創作到專業 3D 內容製作的完整工作流程。
它的核心一直在回答同一個問題:
如何以更少的精力和更短的時間,將複雜的三維物件轉化為可使用的 3D 資產?
即將推出的 V2Fun 2.0 將進一步提升這些能力。

新版本將搭載最新一代 3D 基礎模型,並支援最高 8K 解析度的紋理生成。它將重點提升複雜幾何、人類角色、生物、服裝、雕塑及其他不規則表面的生成品質。
這就是為什麼 V2Fun 與 GPT-6 Astra 的結合不只是一次偶然的產品合作。
它們擅長解決的問題,本質上具有互補性。
GPT-6 Astra 擅長理解、規劃、空間關係、程式設計與智慧體協同。
V2Fun 擅長直接生成複雜的 3D 幾何與高品質表面。
前者更擅長回答:
「這個物件應該如何建構?」
後者更擅長回答:
「這個複雜組件實際上應該呈現什麼樣子?」
當這兩種能力結合後,3D 生成便不再受限於單一方法。
03
挑戰
有些東西適合用程式碼建構,有些則更適合直接生成。
讓我們回到那台挖土機。
從結構上看,它具有高度規律性。
GPT-6 Astra 很容易理解挖土機由底盤、左右履帶、機身、駕駛室、動臂、斗桿與鏟斗組成,也能理解這些零件應如何連接。
但仔細觀察,問題就變了。
駕駛室不是簡單的立方體,機身外殼也無法透過組合幾個基本圖元來精確表示。鏟斗具有連續的曲面,機械臂擁有複雜輪廓,而履帶與底盤則包含大量工業設計細節。
GPT-6 Astra 當然可以繼續使用程序化程式碼來逼近這些結構。
但幾何越複雜,需要生成和修改的程式碼就越多,也需要越多次迭代。
對智慧體而言,這代表要花費越來越多的 token 來描述低階幾何。
因此,我們嘗試了另一種方法。
GPT-6 Astra 首先「理解」挖土機。
接著,它將駕駛室、履帶、機械臂與鏟斗等複雜主要組件,分別交給 V2Fun 2.0 生成。
生成完成後,GPT-6 Astra 再次接手,調整比例、旋轉與位置,並組裝完整物件。
在這裡,V2Fun 正好提供了它一直在發展的能力:
直接從視覺輸入重建複雜的 3D 結構,而不是讓語言模型透過大量程式碼間接描述表面。
這看似只是少寫一些 Three.js,實際上卻改變了整體的計算方式。

更有趣的是,V2Fun 並沒有取代 Three.js。
組裝完成後,GPT-6 Astra 仍然會自行生成許多元素。
例如液壓管。
液壓管本質上是連接幾個關鍵點的管狀結構,非常適合程序化建模。
螺絲、連接軸與操縱桿也是如此。
這些物件尺寸規律、結構簡單,且通常大量出現。若每一個都分別呼叫 3D 基礎模型,反而會增加工作流程的成本與複雜度。
因此,最終的挖土機是真正的混合式資產。
V2Fun 生成複雜的主要組件。
GPT-6 Astra + Three.js 負責規律性的細節。
GPT-6 Astra 再將兩者組織成一個結構完整的 3D 物件。
這正是此方法令人信服的原因:
智慧體不是在程式碼生成與 3D 基礎模型之間二選一,而是為每個部分決定最適合的能力。
04
更複雜的物件
面對人類角色時,V2Fun 的價值更加清晰
挖土機仍然主要是硬表面物件。
真正將純程序化方法推向極限的,是人類角色與複雜的有機表面。
為了探索這一點,我們製作了一個更具野心的展示:
要求 GPT-6 Astra 建構一位全副武裝、身披鎧甲的國王。
除了人體本身,這個角色還包括精細的鎧甲、頭部、劍與盾牌。
與機械設備相比,人類角色更難透過規則表達。
一張臉是否「看起來正確」,不只取決於眼睛、鼻子與嘴巴大致位於正確位置。
臉部形狀、顴骨、眼窩、鼻樑、嘴唇,以及它們之間細微而連續的曲率變化,共同決定了最終外觀。
鎧甲也是如此。
雖然它是硬表面物件,卻不是簡單的工程組件。浮雕、裝飾、連續表面與風格化形態,都構成了角色的視覺特徵。
這些正是 V2Fun 2.0 新一代 3D 基礎模型更適合處理的物件類型。
在這次展示中,GPT-6 Astra 首先理解整個角色,並將其拆分成幾個主要部分:頭部、身體與鎧甲、劍,以及盾牌。
然後由 V2Fun 分別生成這些複雜組件。
接下來的工作交給 GPT-6 Astra:
頭部的比例是否正確,應如何與身體連接?劍與盾牌應放在什麼位置?各部分的比例是否一致?哪些模型需要降低多邊形數量?又應如何將所有內容組織成可編輯且能繼續使用的 3D 資產?
換句話說:
V2Fun 解決「如何快速且高品質地生成複雜幾何」的問題。
GPT-6 Astra 解決「如何將這些幾何轉化為完整物件」的問題。

為什麼 V2Fun 能夠處理這一層複雜幾何?
原因不只是「它同樣是一個圖像轉 3D 模型」。
Vertex Lab 近期的核心研究與開發,聚焦於兩個基本問題:
如何更準確地表現幾何,以及如何讓 高解析度 紋理在 3D 表面保持一致。
在幾何方面,團隊持續改進 3D 表示方式與生成架構,旨在減少低效率的幾何表示,並將模型容量集中於高曲率區域、細薄結構與複雜區域。
在紋理方面,重點是解決高解析度多視角生成中常見的錯位、撕裂與細節遺失問題。
這也支撐了 V2Fun 2.0 生成最高 8K 解析度高品質紋理的能力。
對智慧體而言,這類能力非常重要。
它呼叫的是能夠產生真正 3D 資產的專門模型,而不是只能生成「看起來像 3D」的視覺生成工具。
生成的資產仍然需要由 GPT-6 Astra 進行組裝、降低多邊形數量與修改,之後還可能進入動畫、遊戲、3D 列印或其他 3D 工作流程。
這正是 V2Fun 一直努力解決的產品挑戰:
確保 AI 生成的不只是一次性結果,而是人們真正可以持續使用與製作的 3D 資產。
05
效率
除了更高品質,還有另一項變化:token
這套工作流程還有一項非常直接的好處:
token 效率。
當 GPT-6 Astra 使用 Three.js 描述簡單結構時,token 的使用效率非常高。
一個圓柱體、一條液壓管或幾顆螺絲,只需要很少的程式碼。
但若使用同樣的方法去逼近人臉、布料褶皺或高度複雜的工業表面,需要生成與修改的幾何程式碼量便會迅速增加。
大量 token 會被花在這類問題上:
「如何讓這個表面再精確一點?」
「應該如何進一步調整這個輪廓?」
「這裡應該增加多少幾何細節?」
當複雜部分直接交給 V2Fun,這些低階流程便會濃縮成一次對專門模型的呼叫。
GPT-6 Astra 可以將更多推理資源投入真正需要它做決策的事項:
如何拆解物件;
哪些部分應該分開生成;
各部分在空間中的相互關係;
如何組裝最終物件;
哪些地方需要進一步修改。
這就是為什麼 V2Fun 2.0 帶來的不只是「外觀更好的模型」。
它也有潛力降低 GPT-6 Astra 在複雜 3D 任務中的 token 消耗與整體建模時間。
過去的工作流程可能是:
理解 → 撰寫幾何程式碼 → 修改 → 撰寫更多幾何程式碼 → 再次修改
現在則變成:
理解 → 拆分零件 → 平行生成 → 組裝 → 加入局部細節
當多個複雜組件可以同時生成時,這種效率優勢會更加明顯。
06
結語
從生成模型到成為智慧體的核心 3D 能力
過去幾年,AI 3D 領域的核心問題一直是:
如何生成更好的模型?
但隨著 GPT-6 Astra 這類模型獲得更強的多模態理解、程式設計與智慧體能力,這個問題正在改變。
未來,AI 可能不需要為每項 3D 任務都使用同一種技術。
簡單結構可以直接透過程式碼建構。
複雜表面可以交給 V2Fun。
現有資產可以直接重複使用。
降低多邊形數量、組裝與結構調整,則可以再交還給智慧體。
這與 3D 生成產業從一次性生成工具轉向由智慧體驅動的生產力相一致。參考文章描述了同樣的趨勢:3D 生成正從類似早期聊天機器人的階段,走向由智慧體驅動的生產力階段。
對 Vertex Lab 而言,這個方向與其長期技術願景一致。
從一開始,公司就從未將 V2Fun 定義為一個單純的「圖像轉 3D 網站」。
從讓行動端的 3D 創作更容易,到透過網頁支援專業資產製作,再到 3D 模型、動畫、動作,以及更長期的空間智慧與世界模型探索,Vertex Lab 始終致力於打造 3D 內容生成與空間智慧的基礎設施。
智慧體的崛起,可能會為這個目標開啟一條新道路。
未來,使用者可能不需要知道該呼叫哪個模型、要寫什麼程式碼,或該選擇哪種建模方法。
他們可能只需要說:
「把這個變成 3D。」
GPT-6 Astra 會理解這項要求,並決定如何執行。
V2Fun 2.0 的目標,是成為 GPT-6 Astra 在複雜三維世界中所依賴的專門能力。
GPT-6 Astra 負責理解、規劃與建構。
V2Fun 將複雜的三維構想轉化為真正的資產。
GPT-6 Astra × V2Fun:從程式碼生成到模型協作。
06
結語
從生成模型到成為智慧體的核心 3D 能力
過去幾年,AI 3D 領域的核心問題一直是:
如何生成更好的模型?
但隨著 GPT-6 Astra 這類模型獲得更強的多模態理解、程式設計與智慧體能力,這個問題正在改變。
未來,AI 可能不需要為每項 3D 任務都使用同一種技術。
簡單結構可以直接透過程式碼建構。
複雜表面可以交給 V2Fun。
現有資產可以直接重複使用。
降低多邊形數量、組裝與結構調整,則可以再交還給智慧體。
這與 3D 生成產業從一次性生成工具轉向由智慧體驅動的生產力相一致。參考文章描述了同樣的趨勢:3D 生成正從類似早期聊天機器人的階段,走向由智慧體驅動的生產力階段。
對 Vertex Lab 而言,這個方向與其長期技術願景一致。
從一開始,公司就從未將 V2Fun 定義為一個單純的「圖像轉 3D 網站」。
從讓行動端的 3D 創作更容易,到透過網頁支援專業資產製作,再到 3D 模型、動畫、動作,以及更長期的空間智慧與世界模型探索,Vertex Lab 始終致力於打造 3D 內容生成與空間智慧的基礎設施。
智慧體的崛起,可能會為這個目標開啟一條新道路。
未來,使用者可能不需要知道該呼叫哪個模型、要寫什麼程式碼,或該選擇哪種建模方法。
他們可能只需要說:
「把這個變成 3D。」
GPT-6 Astra 會理解這項要求,並決定如何執行。
V2Fun 2.0 的目標,是成為 GPT-6 Astra 在複雜三維世界中所依賴的專門能力。
GPT-6 Astra 負責理解、規劃與建構。
V2Fun 將複雜的三維構想轉化為真正的資產。
GPT-6 Astra × V2Fun:從程式碼生成到模型協作。
常見問題
Can GPT-6 Astra generate 3D models?
GPT-6 Astra can support 3D creation by reasoning about scenes, planning asset structure, and generating code. For complex geometry, it can work with V2Fun’s 3D foundation models to generate detailed 3D assets.
How does GPT-6 Astra work with V2Fun for 3D generation?
GPT-6 Astra handles reasoning, planning, code generation, and scene assembly, while V2Fun generates complex 3D geometry. Together, they enable an agent-driven workflow for creating structured 3D scenes.
What is a 3D AI agent?
A 3D AI agent is an AI system that can understand a 3D creation task, plan the required steps, generate or retrieve assets, and assemble them into a complete scene with less manual intervention.
Why use V2Fun instead of generating 3D geometry directly with code?
Code works well for simple procedural geometry, but complex organic or detailed assets are harder to create this way. V2Fun’s 3D foundation models are designed to generate these more complex 3D assets from references or prompts.
Can GPT-6 Astra and V2Fun create 3D models from images?
Yes. In the workflow described here, GPT-6 Astra can analyze a reference image and identify the required assets, while V2Fun can generate complex 3D geometry based on those references.
What can GPT-6 Astra and V2Fun be used to create?
The combined workflow can support complex 3D scenes containing multiple assets, including environments, objects, characters, creatures, and other geometry that would be difficult to generate through code alone.



