GPT-6 Astra x V2Fun - De la génération de code à la collaboration entre modèles
Découvrez comment GPT-6 Astra et V2Fun combinent le raisonnement agentique, la génération de code et les modèles de fondation 3D d’IA pour créer des ressources 3D complexes et structurées.
GPT-6 Astra × V2Fun : de la génération de code à la collaboration entre modèles
Imaginez un processus de modélisation 3D comme celui-ci.
Vous fournissez à GPT-6 Astra l’image de référence d’une excavatrice. Il commence par identifier les composants de la machine : la cabine, les chenilles, le châssis inférieur, la flèche, le balancier, le godet, etc.
Ces composants principaux sont ensuite envoyés individuellement à un modèle spécialisé de génération 3D, puis renvoyés sous forme d’assets distincts en quelques dizaines de secondes.
Ensuite, GPT-6 Astra reprend la main.
Il détermine l’échelle et les relations spatiales de chaque pièce, place les chenilles de part et d’autre du châssis inférieur, fixe la flèche au corps, puis relie successivement le balancier et le godet. Une fois la structure principale terminée, il utilise Three.js pour ajouter les flexibles hydrauliques, les vis, les axes de pivot et même les joysticks de commande à l’intérieur de la cabine.
Enfin, une excavatrice complète, structurée et modifiable apparaît dans la scène 3D.
Il s’agit de bien plus que de la génération d’une image vers la 3D, ou de la génération de code seule.
Deux capacités d’IA commencent à collaborer de manière plus naturelle :
GPT-6 Astra se charge de la compréhension, de la planification et de la construction, tandis qu’un modèle de fondation 3D spécialisé gère la géométrie complexe.
Il s’agit d’un nouveau workflow que V2Fun, un produit de Vertex Lab, explore depuis peu.
Cette évolution s’inscrit dans une transformation plus large :
Les agents 3D passent de la « génération autonome de tout » à la capacité de « savoir quel modèle appeler et quand ».

01
TOURNANT
GPT-6 Astra peut déjà construire en 3D. Quelle sera la prochaine étape ?
L’un des changements majeurs apportés par GPT-6 Astra est que les grands modèles de langage entrent véritablement dans le monde tridimensionnel.
Auparavant, nous avions davantage l’habitude de demander à l’IA de générer une image, une vidéo ou un texte. Désormais, grâce à une compréhension multimodale, un raisonnement spatial et des capacités de programmation toujours plus avancés, GPT-6 Astra peut comprendre la structure d’un objet 3D, puis réellement le construire à l’aide de méthodes procédurales telles que Three.js.
Prenons l’exemple d’une ligne de production industrielle.
GPT-6 Astra peut identifier ses convoyeurs, ses rouleaux, ses structures de support, ses moteurs et ses postes de travail, puis générer progressivement la géométrie correspondante.
Ces objets sont particulièrement adaptés à la modélisation procédurale, car ils présentent généralement des relations mathématiques claires et des structures répétitives. Un pilier de support peut être représenté par une forme géométrique élémentaire, un rouleau peut être dupliqué des dizaines de fois et la longueur ainsi que la position d’un convoyeur peuvent être contrôlées directement par des paramètres.
Plus important encore, le résultat n’est pas un maillage entièrement opaque.
Chaque composant de la ligne de production reste un objet distinct qui peut encore être déplacé, dupliqué, supprimé ou modifié.
De ce point de vue, GPT-6 Astra fait plus que « générer de la 3D ». Il commence à développer une capacité plus proche de celle d’un ingénieur 3D :
Comprendre de quoi un objet est constitué et le construire.

Mais à mesure que les objets deviennent plus complexes, une nouvelle question se pose.
Que se passe-t-il si l’objet n’est pas une ligne de production, mais un visage humain, une créature, un vêtement, une sculpture ou même une excavatrice aux surfaces industrielles complexes ? GPT-6 Astra doit-il encore écrire toute la géométrie sous forme de code ?
La réponse n’est peut-être pas un choix exclusif.
Et c’est précisément là que V2Fun peut s’intégrer au workflow.
02
POURQUOI V2FUN
Pourquoi V2Fun ?
V2Fun n’est pas une API 3D ajoutée à la volée uniquement pour cette démonstration.
Il s’agit de la plateforme produit dédiée aux travaux de recherche et de développement à long terme de Vertex Lab dans le domaine des modèles de fondation 3D d’IA.
Fondé en 2025, Vertex Lab se concentre depuis toujours sur la génération 3D, l’intelligence spatiale et, à plus long terme, les infrastructures pour les modèles du monde.
V2Fun a été présenté auparavant au HDC 2026 comme la première application native de l’IA d’HarmonyOS propulsée par un modèle de fondation 3D. Son application mobile et son espace de travail web couvrent l’ensemble du workflow, de la création quotidienne à la production professionnelle de contenus 3D.
Au cœur de ses activités se trouve toujours la même question :
Comment transformer un objet tridimensionnel complexe en asset 3D utilisable, avec moins d’efforts et en moins de temps ?
Le prochain V2Fun 2.0 ira encore plus loin.

La nouvelle version intégrera la dernière génération de son modèle de fondation 3D et prendra en charge la génération de textures avec des résolutions allant jusqu’à 8K. Elle se concentrera sur l’amélioration de la qualité de génération pour les géométries complexes, les personnages humains, les créatures, les vêtements, les sculptures et autres surfaces irrégulières.
C’est pourquoi la combinaison de V2Fun et de GPT-6 Astra représente davantage qu’une collaboration ponctuelle entre produits.
Les problèmes qu’ils excellent à résoudre sont intrinsèquement complémentaires.
GPT-6 Astra excelle dans la compréhension, la planification, les relations spatiales, la programmation et l’orchestration des agents.
V2Fun excelle dans la génération directe de géométries 3D complexes et de surfaces de haute qualité.
L’un est meilleur pour répondre à la question :
« Comment cet objet doit-il être construit ? »
L’autre est meilleur pour répondre à la question :
« À quoi ce composant complexe doit-il réellement ressembler ? »
Une fois ces deux capacités réunies, la génération 3D n’est plus limitée à une seule approche.
03
DÉFI
Certaines choses sont mieux construites avec du code. D’autres sont mieux générées directement.
Revenons à cette excavatrice.
Sur le plan structurel, elle est très régulière.
GPT-6 Astra peut facilement comprendre qu’une excavatrice se compose d’un châssis inférieur, de chenilles gauche et droite, d’un corps, d’une cabine, d’une flèche, d’un balancier et d’un godet. Il peut également comprendre comment ces pièces doivent être reliées.
Mais en y regardant de plus près, le problème change.
La cabine n’est pas un simple cube et la carrosserie ne peut pas être représentée précisément en combinant quelques primitives. Le godet présente des surfaces courbes continues, le bras possède un contour complexe et les chenilles ainsi que le châssis inférieur contiennent une multitude de détails de conception industrielle.
GPT-6 Astra peut bien sûr continuer à approximer ces structures avec du code procédural.
Mais plus la géométrie est complexe, plus il faut générer et réviser de code, et plus le nombre d’itérations nécessaires augmente.
Pour un agent, cela signifie consacrer toujours plus de tokens à la description de géométries bas niveau.
Nous avons donc essayé une approche différente.
GPT-6 Astra commence par « comprendre » l’excavatrice.
Il délègue ensuite les composants principaux complexes, tels que la cabine, les chenilles, le bras et le godet, à V2Fun 2.0 pour une génération séparée.
Une fois la génération terminée, GPT-6 Astra reprend la main pour ajuster l’échelle, la rotation et la position, puis assembler l’objet complet.
V2Fun apporte ici exactement la capacité qu’il développe :
Reconstruire directement des structures 3D complexes à partir d’entrées visuelles, au lieu de demander à un modèle de langage de décrire indirectement les surfaces à l’aide de grandes quantités de code.
Cela peut sembler revenir simplement à écrire moins de Three.js, mais cela transforme en réalité toute l’approche informatique.

Plus intéressant encore, V2Fun ne remplace pas Three.js.
Après l’assemblage, GPT-6 Astra génère toujours lui-même de nombreux éléments.
Les flexibles hydrauliques, par exemple.
Un flexible est essentiellement une structure tubulaire reliant quelques points clés, ce qui le rend idéal pour la modélisation procédurale.
Il en va de même pour les vis, les axes de liaison et les joysticks.
Ces objets ont des dimensions régulières, des structures simples et apparaissent souvent en grand nombre. Appeler séparément un modèle de fondation 3D pour chacun d’eux ajouterait en réalité du coût et de la complexité au workflow.
L’excavatrice finale est donc un véritable asset hybride.
V2Fun génère les composants principaux complexes.
GPT-6 Astra + Three.js se chargent des détails réguliers.
GPT-6 Astra organise ensuite les deux types d’éléments en un objet 3D unique et structuré.
C’est ce qui rend cette approche convaincante :
Au lieu de choisir entre la génération de code et un modèle de fondation 3D, l’agent détermine quelle capacité convient le mieux à chaque partie.
04
PLUS COMPLEXE
Avec les personnages humains, la valeur de V2Fun devient encore plus évidente
L’excavatrice reste principalement un objet à surface dure.
Les personnages humains et les surfaces organiques complexes sont ce qui pousse véritablement une approche purement procédurale à ses limites.
Pour l’explorer, nous avons créé une démonstration plus ambitieuse :
Demander à GPT-6 Astra de construire un roi entièrement armé et cuirassé.
Au-delà du corps humain lui-même, ce personnage comprend une armure détaillée, une tête, une épée et un bouclier.
Les personnages humains sont beaucoup plus difficiles à exprimer par des règles que les équipements mécaniques.
Qu’un visage « ait l’air juste » dépend de bien plus que du placement approximativement correct des yeux, du nez et de la bouche.
La forme du visage, les pommettes, les orbites, l’arête du nez, les lèvres et les variations subtiles et continues de courbure entre ces éléments contribuent tous à l’apparence finale.
Il en va de même pour l’armure.
Bien qu’il s’agisse d’un objet à surface dure, ce n’est pas un simple composant d’ingénierie. Les reliefs, les ornements, les surfaces continues et les formes stylisées contribuent tous à l’identité visuelle du personnage.
Ce sont précisément les types d’objets que le modèle de fondation 3D de nouvelle génération de V2Fun 2.0 est mieux à même de gérer.
Dans cette démonstration, GPT-6 Astra comprend d’abord le personnage dans son ensemble et le divise en plusieurs parties principales : la tête, le corps et l’armure, l’épée et le bouclier.
V2Fun génère ensuite séparément ces composants complexes.
GPT-6 Astra s’occupe de la suite :
La tête est-elle correctement mise à l’échelle et comment doit-elle être reliée au corps ? Où placer l’épée et le bouclier ? Les proportions des différentes parties sont-elles cohérentes ? Quels modèles doivent subir une réduction polygonale ? Et comment organiser le tout en un asset 3D qui puisse être modifié et réutilisé ?
En d’autres termes :
V2Fun répond à la question « comment générer rapidement une géométrie complexe et de haute qualité ».
GPT-6 Astra répond à la question « comment transformer cette géométrie en un objet complet ».

Pourquoi V2Fun peut-il gérer ce niveau de géométrie complexe ?
La raison va au-delà du fait qu’il s’agit également d’un « modèle de conversion image-vers-3D ».
Les travaux fondamentaux de recherche et de développement menés récemment par Vertex Lab se concentrent sur deux questions essentielles :
Comment représenter la géométrie avec plus de précision et comment conserver la cohérence des textures haute résolution sur les surfaces 3D.
Du côté de la géométrie, l’équipe continue d’affiner ses représentations 3D et son architecture de génération, afin de réduire les représentations géométriques inefficaces et de concentrer la capacité du modèle sur les zones à forte courbure, les structures fines et les régions complexes.
Du côté des textures, l’objectif est de résoudre les problèmes de désalignement, de déchirement et de perte de détails qui surviennent fréquemment lors de la génération multivue haute résolution.
Cela sous-tend également la capacité de V2Fun 2.0 à fournir des textures de haute qualité avec des résolutions allant jusqu’à 8K.
Pour un agent, de telles capacités sont très importantes.
Il fait appel à un modèle spécialisé qui produit de véritables assets 3D, plutôt qu’à un outil de génération visuelle qui crée simplement quelque chose qui « ressemble à de la 3D ».
Les assets générés doivent encore être assemblés, voir leur nombre de polygones réduit et être modifiés par GPT-6 Astra, avant de pouvoir éventuellement intégrer des workflows d’animation, de jeu vidéo, d’impression 3D ou d’autres domaines de la 3D.
C’est le défi produit que V2Fun cherche à relever :
Faire en sorte que l’IA génère plus qu’un résultat ponctuel : un asset 3D avec lequel les utilisateurs peuvent réellement continuer à travailler.
05
EFFICACITÉ
Au-delà de la qualité, un autre changement : les tokens
Ce workflow présente un autre avantage très concret :
L’efficacité en tokens.
Lorsque GPT-6 Astra utilise Three.js pour décrire une structure simple, il exploite les tokens très efficacement.
Un cylindre, un flexible hydraulique ou quelques vis nécessitent très peu de code.
Mais appliquer la même méthode pour approximer des visages humains, des plis de tissu ou des surfaces industrielles très complexes augmente rapidement la quantité de code géométrique à générer et à réviser.
Un grand nombre de tokens est alors consacré à des questions telles que :
« Comment rendre cette surface un peu plus précise ? »
« Comment ajuster davantage ce contour ? »
« Quelle quantité de détails géométriques faut-il ajouter ici ? »
Lorsque les parties complexes sont directement déléguées à V2Fun, ces processus bas niveau sont condensés en un seul appel à un modèle spécialisé.
GPT-6 Astra peut consacrer davantage de ses ressources de raisonnement aux décisions qui le nécessitent réellement :
Comment décomposer l’objet ;
Quelles parties doivent être générées séparément ;
Comment les parties se rapportent les unes aux autres dans l’espace ;
Comment assembler l’objet final ;
Où d’autres modifications sont nécessaires.
C’est pourquoi V2Fun 2.0 offre plus que des « modèles plus beaux ».
Il pourrait également réduire la consommation de tokens et le temps total de modélisation de GPT-6 Astra pour les tâches 3D complexes.
Le workflow pouvait auparavant être :
Comprendre → Écrire le code de géométrie → Réviser → Écrire davantage de code de géométrie → Réviser à nouveau
Il devient désormais :
Comprendre → Décomposer en parties → Générer en parallèle → Assembler → Ajouter les détails locaux
Lorsque plusieurs composants complexes peuvent être générés simultanément, cet avantage en matière d’efficacité devient encore plus important.
06
CONCLUSION
De la génération d’un modèle à une capacité 3D essentielle pour les agents
Au cours des dernières années, la question centrale de l’IA 3D était :
Comment générer un meilleur modèle ?
Mais à mesure que des modèles comme GPT-6 Astra acquièrent de meilleures capacités de compréhension multimodale, de programmation et d’agent, cette question évolue.
À l’avenir, l’IA n’aura peut-être pas besoin d’utiliser une seule technique pour chaque tâche 3D.
Les structures simples pourront être codées directement.
Les surfaces complexes pourront être déléguées à V2Fun.
Les assets existants pourront être réutilisés tels quels.
La réduction du nombre de polygones, l’assemblage et les ajustements structurels pourront ensuite être confiés à nouveau à l’agent.
Cette évolution correspond au passage de l’industrie de la génération 3D des outils de génération ponctuelle à une productivité pilotée par les agents. L’article de référence décrit la même tendance : la génération 3D passe d’une étape comparable à celle des premiers chatbots à une phase de productivité alimentée par les agents.
Pour Vertex Lab, cette orientation est cohérente avec sa vision technique à long terme.
Depuis ses débuts, l’entreprise n’a jamais défini V2Fun comme un simple « site de conversion image-vers-3D ».
De la démocratisation de la création 3D sur mobile à la production professionnelle d’assets sur le web, en passant par les modèles 3D, l’animation, le mouvement et la quête à long terme de l’intelligence spatiale et des modèles du monde, Vertex Lab a toujours cherché à construire une infrastructure pour la génération de contenus 3D et l’intelligence spatiale.
L’essor des agents pourrait ouvrir une nouvelle voie vers cet objectif.
À l’avenir, les utilisateurs n’auront peut-être pas besoin de savoir quel modèle appeler, quel code écrire ou quelle méthode de modélisation choisir.
Ils auront peut-être seulement besoin de dire :
« Transforme ceci en 3D. »
GPT-6 Astra comprendra la demande et décidera de la manière de l’exécuter.
V2Fun 2.0 entend devenir la capacité spécialisée sur laquelle il s’appuie pour le monde tridimensionnel complexe.
GPT-6 Astra se charge de la compréhension, de la planification et de la construction.
V2Fun transforme les idées tridimensionnelles complexes en véritables assets.
GPT-6 Astra × V2Fun : de la génération de code à la collaboration entre modèles.
06
CONCLUSION
De la génération d’un modèle à une capacité 3D essentielle pour les agents
Au cours des dernières années, la question centrale de l’IA 3D était :
Comment générer un meilleur modèle ?
Mais à mesure que des modèles comme GPT-6 Astra acquièrent de meilleures capacités de compréhension multimodale, de programmation et d’agent, cette question évolue.
À l’avenir, l’IA n’aura peut-être pas besoin d’utiliser une seule technique pour chaque tâche 3D.
Les structures simples pourront être codées directement.
Les surfaces complexes pourront être déléguées à V2Fun.
Les assets existants pourront être réutilisés tels quels.
La réduction du nombre de polygones, l’assemblage et les ajustements structurels pourront ensuite être confiés à nouveau à l’agent.
Cette évolution correspond au passage de l’industrie de la génération 3D des outils de génération ponctuelle à une productivité pilotée par les agents. L’article de référence décrit la même tendance : la génération 3D passe d’une étape comparable à celle des premiers chatbots à une phase de productivité alimentée par les agents.
Pour Vertex Lab, cette orientation est cohérente avec sa vision technique à long terme.
Depuis ses débuts, l’entreprise n’a jamais défini V2Fun comme un simple « site de conversion image-vers-3D ».
De la démocratisation de la création 3D sur mobile à la production professionnelle d’assets sur le web, en passant par les modèles 3D, l’animation, le mouvement et la quête à long terme de l’intelligence spatiale et des modèles du monde, Vertex Lab a toujours cherché à construire une infrastructure pour la génération de contenus 3D et l’intelligence spatiale.
L’essor des agents pourrait ouvrir une nouvelle voie vers cet objectif.
À l’avenir, les utilisateurs n’auront peut-être pas besoin de savoir quel modèle appeler, quel code écrire ou quelle méthode de modélisation choisir.
Ils auront peut-être seulement besoin de dire :
« Transforme ceci en 3D. »
GPT-6 Astra comprendra la demande et décidera de la manière de l’exécuter.
V2Fun 2.0 entend devenir la capacité spécialisée sur laquelle il s’appuie pour le monde tridimensionnel complexe.
GPT-6 Astra se charge de la compréhension, de la planification et de la construction.
V2Fun transforme les idées tridimensionnelles complexes en véritables assets.
GPT-6 Astra × V2Fun : de la génération de code à la collaboration entre modèles.
FAQ
Can GPT-6 Astra generate 3D models?
GPT-6 Astra can support 3D creation by reasoning about scenes, planning asset structure, and generating code. For complex geometry, it can work with V2Fun’s 3D foundation models to generate detailed 3D assets.
How does GPT-6 Astra work with V2Fun for 3D generation?
GPT-6 Astra handles reasoning, planning, code generation, and scene assembly, while V2Fun generates complex 3D geometry. Together, they enable an agent-driven workflow for creating structured 3D scenes.
What is a 3D AI agent?
A 3D AI agent is an AI system that can understand a 3D creation task, plan the required steps, generate or retrieve assets, and assemble them into a complete scene with less manual intervention.
Why use V2Fun instead of generating 3D geometry directly with code?
Code works well for simple procedural geometry, but complex organic or detailed assets are harder to create this way. V2Fun’s 3D foundation models are designed to generate these more complex 3D assets from references or prompts.
Can GPT-6 Astra and V2Fun create 3D models from images?
Yes. In the workflow described here, GPT-6 Astra can analyze a reference image and identify the required assets, while V2Fun can generate complex 3D geometry based on those references.
What can GPT-6 Astra and V2Fun be used to create?
The combined workflow can support complex 3D scenes containing multiple assets, including environments, objects, characters, creatures, and other geometry that would be difficult to generate through code alone.



