Producto y tecnología

GPT-6 Astra x V2Fun - De la generación de código a la colaboración entre modelos

Descubre cómo GPT-6 Astra y V2Fun combinan el razonamiento de agentes, la generación de código y los modelos fundacionales de IA 3D para crear activos 3D complejos y estructurados.

GPT-6 Astra × V2Fun: de la generación de código a la ​colaboración entre modelos

Imagina un proceso de modelado 3D como este.

Le das a GPT-6 Astra una imagen de referencia de una excavadora. Primero identifica los componentes de la máquina: la cabina, las orugas, el tren de rodaje, la pluma, el brazo, el cucharón y otros elementos.

Estos componentes principales se envían individualmente a un modelo especializado de generación 3D y se devuelven como recursos independientes en cuestión de decenas de segundos.

A continuación, GPT-6 Astra toma el control.

Determina la escala y las relaciones espaciales de cada pieza, coloca las orugas a ambos lados del tren de rodaje, conecta la pluma al cuerpo y, después, une el brazo y el cucharón en secuencia. Una vez completada la estructura principal, utiliza Three.js para añadir mangueras hidráulicas, tornillos, ejes de pivote e incluso las palancas de control dentro de la cabina.

Finalmente, en la escena 3D aparece una excavadora completa, estructurada y editable.

Esto es más que una simple generación de imagen a 3D o una simple generación de código.

Son dos capacidades de IA que comienzan a trabajar juntas de una forma más natural:

GPT-6 Astra se encarga de la comprensión, la planificación y la construcción, mientras que un modelo fundacional 3D especializado se encarga de la geometría compleja.

Este es un nuevo flujo de trabajo que ​V2Fun​, un producto de Vertex Lab, ha estado explorando recientemente.

Detrás de ello se encuentra un cambio más amplio:

Los agentes 3D están pasando de “generarlo todo por sí mismos” a “saber qué modelo utilizar y cuándo”.

https://external-v2fun-data-hk-1.oss-accelerate.aliyuncs.com/temp/2026/09/08/1_1788847729013.png


01

PUNTO DE INFLEXIÓN

GPT-6 Astra ya puede construir en 3D. ¿Qué viene después?

Uno de los cambios significativos introducidos por GPT-6 Astra es que los grandes modelos de lenguaje están entrando realmente en el mundo tridimensional.

En el pasado, estábamos más acostumbrados a pedirle a la IA que generara una imagen, un vídeo o un fragmento de texto. Ahora, gracias a una comprensión multimodal, un razonamiento espacial y unas capacidades de programación cada vez más avanzados, GPT-6 Astra puede comprender la estructura de un objeto 3D y después construirlo realmente mediante métodos procedurales como Three.js.

Tomemos como ejemplo una línea de producción industrial.

GPT-6 Astra puede identificar sus cintas transportadoras, rodillos, estructuras de soporte, motores y estaciones de trabajo, y después generar progresivamente la geometría correspondiente.

Estos objetos son especialmente adecuados para el modelado procedural porque suelen tener relaciones matemáticas claras y estructuras repetitivas. Una columna de soporte puede representarse mediante una forma geométrica básica, un rodillo puede duplicarse decenas de veces y la longitud y la posición de una cinta transportadora pueden controlarse directamente mediante parámetros.

Y lo que es más importante, el resultado no es una malla completamente opaca.

Cada componente de la línea de producción sigue siendo un objeto independiente que todavía puede moverse, duplicarse, eliminarse o modificarse.

Desde esta perspectiva, GPT-6 Astra hace algo más que “generar 3D”. Está comenzando a desarrollar una capacidad más cercana a la de un ingeniero 3D:

Comprender de qué está hecho un objeto y construirlo.

https://external-v2fun-data-hk-1.oss-accelerate.aliyuncs.com/temp/2026/09/08/2_1788847773702.png

Pero a medida que los objetos se vuelven más complejos, surge una nueva pregunta.

¿Qué ocurre si el objeto no es una línea de producción, sino un rostro humano, una criatura, ropa, una escultura o incluso una excavadora con superficies industriales complejas? ¿Debería GPT-6 Astra seguir escribiendo toda la geometría en código?

La respuesta quizá no tenga que ser una cosa o la otra.

Y este es precisamente el punto en el que V2Fun puede incorporarse al flujo de trabajo.


02

POR QUÉ V2FUN

¿Por qué V2Fun?

V2Fun no es una API 3D añadida sobre la marcha solo para esta demostración.

Es la plataforma de producto para la investigación y el desarrollo a largo plazo de Vertex Lab en modelos fundacionales 3D de IA.

Fundado en 2025, Vertex Lab se ha centrado constantemente en la generación 3D, la inteligencia espacial y, a largo plazo, la infraestructura para modelos del mundo.

V2Fun se presentó anteriormente en HDC 2026 como la primera aplicación nativa de IA de HarmonyOS impulsada por un modelo fundacional 3D. Su aplicación móvil y su espacio de trabajo web abarcan todo el flujo de trabajo, desde la creación cotidiana hasta la producción profesional de contenido 3D.

En esencia, siempre ha abordado la misma pregunta:

¿Cómo se puede convertir un objeto tridimensional complejo en un recurso 3D utilizable, con menos esfuerzo y en menos tiempo?

La próxima V2Fun 2.0 llevará estas capacidades aún más lejos.

https://external-v2fun-data-hk-1.oss-accelerate.aliyuncs.com/temp/2026/09/08/3_1788847859532.png

La nueva versión contará con la última generación de su modelo fundacional 3D y admitirá la generación de texturas con resoluciones de hasta 8K. Se centrará en mejorar la calidad de generación para geometrías complejas, personajes humanos, criaturas, ropa, esculturas y otras superficies irregulares.

Por eso, la combinación de V2Fun y GPT-6 Astra es más que una colaboración ocasional entre productos.

Los problemas que cada uno resuelve especialmente bien son inherentemente complementarios.

GPT-6 Astra destaca en comprensión, planificación, relaciones espaciales, programación y orquestación de agentes.

V2Fun destaca en la generación directa de geometría 3D compleja y superficies de alta calidad.

Uno responde mejor a la pregunta:

“¿Cómo debería construirse este objeto?”

El otro responde mejor a:

“¿Qué aspecto debería tener realmente este componente complejo?”

Cuando estas dos capacidades se unen, la generación 3D deja de estar limitada a un único enfoque.


03

DESAFÍO

Algunas cosas se construyen mejor con código. Otras se generan mejor directamente.

Volvamos a esa excavadora.

Desde el punto de vista estructural, es muy regular.

GPT-6 Astra puede comprender fácilmente que una excavadora consta de un tren de rodaje, orugas izquierda y derecha, un cuerpo, una cabina, una pluma, un brazo y un cucharón. También puede comprender cómo deben conectarse esas piezas.

Pero si observamos con más atención, el problema cambia.

La cabina no es un cubo sencillo, y la carcasa del cuerpo no puede representarse con precisión combinando unos pocos elementos primitivos. El cucharón tiene superficies curvas continuas, el brazo presenta un contorno complejo y las orugas y el tren de rodaje contienen una gran cantidad de detalles de diseño industrial.

GPT-6 Astra puede seguir aproximando estas estructuras mediante código procedural.

Pero cuanto más compleja es la geometría, más código hay que generar y revisar, y más iteraciones se necesitan.

Para un agente, esto significa dedicar cada vez más tokens a describir geometría de bajo nivel.

Así que probamos un enfoque diferente.

GPT-6 Astra primero “comprende” la excavadora.

Después delega los componentes principales complejos, como la cabina, las orugas, el brazo y el cucharón, a V2Fun 2.0 para que los genere por separado.

Una vez completada la generación, GPT-6 Astra vuelve a tomar el control para ajustar la escala, la rotación y la posición, y ensamblar el objeto completo.

Aquí, V2Fun aporta exactamente la capacidad que ha estado desarrollando:

Reconstruir directamente estructuras 3D complejas a partir de información visual, en lugar de hacer que un modelo de lenguaje describa indirectamente las superficies mediante grandes cantidades de código.

Puede parecer que simplemente se escribe menos código de Three.js, pero en realidad cambia todo el enfoque computacional.

https://external-v2fun-data-hk-1.oss-accelerate.aliyuncs.com/temp/2026/09/08/4_1788847909833.png

Y lo que resulta más interesante es que V2Fun no sustituye a Three.js.

Después del ensamblaje, GPT-6 Astra sigue generando muchos elementos por sí mismo.

Por ejemplo, las mangueras hidráulicas.

Una manguera es, en esencia, una estructura tubular que conecta unos pocos puntos clave, por lo que resulta ideal para el modelado procedural.

Lo mismo se aplica a los tornillos, los ejes de conexión y las palancas de control.

Estos objetos tienen dimensiones regulares, estructuras sencillas y suelen aparecer en grandes cantidades. Llamar por separado a un modelo fundacional 3D para cada uno añadiría costes y complejidad al flujo de trabajo.

Por tanto, la excavadora final es un recurso verdaderamente híbrido.

V2Fun genera los componentes principales complejos.

GPT-6 Astra + Three.js se encarga de los detalles regulares.

A continuación, GPT-6 Astra organiza ambos en un único objeto 3D estructurado.

Esto es lo que hace convincente este enfoque:

En lugar de elegir entre la generación de código y un modelo fundacional 3D, el agente decide qué capacidad se adapta mejor a cada parte.


04

MÁS COMPLEJIDAD

Con personajes humanos, el valor de V2Fun resulta aún más claro

La excavadora sigue siendo principalmente un objeto de superficie dura.

Los personajes humanos y las superficies orgánicas complejas son los que realmente llevan un enfoque puramente procedural hasta sus límites.

Para explorarlo, creamos una demostración más ambiciosa:

Pedirle a GPT-6 Astra que construya un rey completamente armado y acorazado.

Además del cuerpo humano, este personaje incluye una armadura intrincada, una cabeza, una espada y un escudo.

Los personajes humanos son mucho más difíciles de expresar mediante reglas que los equipos mecánicos.

Que un rostro “tenga el aspecto correcto” depende de algo más que de colocar los ojos, la nariz y la boca aproximadamente en las posiciones correctas.

La forma del rostro, los pómulos, las cuencas de los ojos, el puente de la nariz, los labios y los cambios sutiles y continuos de curvatura entre todos ellos contribuyen al aspecto final.

Lo mismo ocurre con la armadura.

Aunque es un objeto de superficie dura, no es un componente de ingeniería sencillo. Los relieves, la ornamentación, las superficies continuas y las formas estilizadas contribuyen a la identidad visual del personaje.

Estos son precisamente los tipos de objetos para los que está mejor preparado el modelo fundacional 3D de nueva generación de V2Fun 2.0.

En esta demostración, GPT-6 Astra primero comprende el personaje en su conjunto y lo divide en varias partes principales: la cabeza, el cuerpo y la armadura, la espada y el escudo.

Después, V2Fun genera estos componentes complejos por separado.

GPT-6 Astra se encarga de lo que viene a continuación:

¿La cabeza tiene la escala correcta y cómo debería conectarse al cuerpo? ¿Dónde deberían colocarse la espada y el escudo? ¿Son coherentes las proporciones de las piezas? ¿Qué modelos necesitan una reducción del número de polígonos? ¿Y cómo debería organizarse todo en un recurso 3D que pueda editarse y seguir utilizándose?

En otras palabras:

V2Fun aborda “cómo generar geometría compleja rápidamente y con alta calidad”.

GPT-6 Astra aborda “cómo convertir esa geometría en un objeto completo”.

https://external-v2fun-data-hk-1.oss-accelerate.aliyuncs.com/temp/2026/09/08/5_1788847954398.jpeg

¿Por qué V2Fun puede gestionar este nivel de geometría compleja?

La razón va más allá de que “también sea un modelo de imagen a 3D”.

La investigación y el desarrollo fundamentales de Vertex Lab en los últimos tiempos se han centrado en dos preguntas esenciales:

Cómo representar la geometría con mayor precisión y cómo mantener ​texturas de alta resolución​ coherentes en las superficies 3D.

En el ámbito de la geometría, el equipo continúa perfeccionando sus representaciones 3D y su arquitectura de generación, con el objetivo de reducir las representaciones geométricas ineficientes y concentrar la capacidad del modelo en áreas de alta curvatura, estructuras delgadas y regiones complejas.

En el ámbito de las texturas, el objetivo es abordar la desalineación, los desgarros y la pérdida de detalle que suelen producirse en la generación multivista de alta resolución.

Esto también sustenta la capacidad de V2Fun 2.0 para ofrecer texturas de alta calidad con resoluciones de hasta 8K.

Para un agente, capacidades como estas son muy importantes.

Está llamando a un modelo especializado que produce recursos 3D reales, en lugar de una herramienta de generación visual que simplemente crea algo que “parece 3D”.

Los recursos generados todavía deben ser ensamblados, reducir su número de polígonos y modificados por GPT-6 Astra, y quizá posteriormente se incorporen a procesos de animación, videojuegos, impresión 3D u otros flujos de trabajo 3D.

Este es el desafío de producto que V2Fun ha estado intentando resolver:

Garantizar que la IA genere algo más que un resultado aislado: un recurso 3D con el que las personas puedan seguir trabajando de verdad.


05

EFICIENCIA

Más allá de una mayor calidad, hay otro cambio: los tokens

Este flujo de trabajo tiene otro beneficio muy directo:

Eficiencia de tokens.

Cuando GPT-6 Astra utiliza Three.js para describir una estructura sencilla, emplea los tokens de forma muy eficiente.

Un cilindro, una manguera hidráulica o unos pocos tornillos requieren muy poco código.

Pero aplicar el mismo método para aproximar rostros humanos, pliegues de tela o superficies industriales muy complejas aumenta rápidamente la cantidad de código geométrico que debe generarse y revisarse.

Entonces se gastan grandes cantidades de tokens en preguntas como:

“¿Cómo se puede hacer esta superficie un poco más precisa?”

“¿Cómo debería ajustarse aún más este contorno?”

“¿Cuánto detalle geométrico debería añadirse aquí?”

Cuando las partes complejas se delegan directamente a V2Fun, estos procesos de bajo nivel se condensan en una única llamada a un modelo especializado.

GPT-6 Astra puede dedicar más recursos de razonamiento a las decisiones que realmente los necesitan:

Cómo dividir el objeto;

Qué partes deberían generarse por separado;

Cómo se relacionan espacialmente las piezas entre sí;

Cómo ensamblar el objeto final;

Dónde se necesitan más cambios.

Por eso V2Fun 2.0 ofrece algo más que “modelos de mejor aspecto”.

También tiene el potencial de reducir tanto el consumo de tokens como el tiempo total de modelado de GPT-6 Astra en tareas 3D complejas.

Anteriormente, el flujo de trabajo podía ser:

Comprender → Escribir código geométrico → Revisar → Escribir más código geométrico → Volver a revisar

Ahora se convierte en:

Comprender → Dividir en partes → Generar en paralelo → Ensamblar → Añadir detalles locales

Cuando se pueden generar simultáneamente varios componentes complejos, esta ventaja de eficiencia es aún mayor.

06

CIERRE

De generar un modelo a convertirse en una capacidad 3D esencial para los agentes

Durante los últimos años, la pregunta central de la IA 3D ha sido:

¿Cómo generamos un modelo mejor?

Pero a medida que modelos como GPT-6 Astra adquieren capacidades más sólidas de comprensión multimodal, programación y actuación como agentes, esa pregunta está cambiando.

En el futuro, la IA quizá no necesite utilizar una única técnica para cada tarea 3D.

Las estructuras sencillas pueden codificarse directamente.

Las superficies complejas pueden delegarse a V2Fun.

Los recursos existentes pueden reutilizarse tal como están.

Después, la reducción de polígonos, el ensamblaje y los ajustes estructurales pueden devolverse al agente.

Esto coincide con el cambio de la industria de la generación 3D, que pasa de herramientas de generación aislada a una productividad impulsada por agentes. El artículo de referencia describe la misma tendencia: la generación 3D está pasando de una etapa similar a la de los primeros chatbots a una fase de productividad impulsada por agentes.

Para Vertex Lab, esta dirección es coherente con su visión técnica a largo plazo.

Desde el principio, la empresa nunca ha definido V2Fun simplemente como un “sitio web de imagen a 3D”.

Desde hacer más accesible la creación 3D en dispositivos móviles, hasta permitir la producción profesional de recursos en la web, pasando por los modelos 3D, la animación, el movimiento y la búsqueda a largo plazo de inteligencia espacial y modelos del mundo, Vertex Lab siempre ha aspirado a construir una infraestructura para la generación de contenido 3D y la inteligencia espacial.

El auge de los agentes puede abrir un nuevo camino hacia ese objetivo.

En el futuro, los usuarios quizá no necesiten saber a qué modelo llamar, qué código escribir o qué método de modelado elegir.

Puede que solo tengan que decir:

“Convierte esto en 3D.”

GPT-6 Astra comprenderá la solicitud y decidirá cómo llevarla a cabo.

V2Fun 2.0 aspira a convertirse en la capacidad especializada en la que se apoya para el complejo mundo tridimensional.

GPT-6 Astra se encarga de la comprensión, la planificación y la construcción.

V2Fun convierte las ideas tridimensionales complejas en recursos reales.

GPT-6 Astra × V2Fun: de la generación de código a la colaboración entre modelos.

06

CIERRE

De generar un modelo a convertirse en una capacidad 3D esencial para los agentes

Durante los últimos años, la pregunta central de la IA 3D ha sido:

¿Cómo generamos un modelo mejor?

Pero a medida que modelos como GPT-6 Astra adquieren capacidades más sólidas de comprensión multimodal, programación y actuación como agentes, esa pregunta está cambiando.

En el futuro, la IA quizá no necesite utilizar una única técnica para cada tarea 3D.

Las estructuras sencillas pueden codificarse directamente.

Las superficies complejas pueden delegarse a V2Fun.

Los recursos existentes pueden reutilizarse tal como están.

Después, la reducción de polígonos, el ensamblaje y los ajustes estructurales pueden devolverse al agente.

Esto coincide con el cambio de la industria de la generación 3D, que pasa de herramientas de generación aislada a una productividad impulsada por agentes. El artículo de referencia describe la misma tendencia: la generación 3D está pasando de una etapa similar a la de los primeros chatbots a una fase de productividad impulsada por agentes.

Para Vertex Lab, esta dirección es coherente con su visión técnica a largo plazo.

Desde el principio, la empresa nunca ha definido V2Fun simplemente como un “sitio web de imagen a 3D”.

Desde hacer más accesible la creación 3D en dispositivos móviles, hasta permitir la producción profesional de recursos en la web, pasando por los modelos 3D, la animación, el movimiento y la búsqueda a largo plazo de inteligencia espacial y modelos del mundo, Vertex Lab siempre ha aspirado a construir una infraestructura para la generación de contenido 3D y la inteligencia espacial.

El auge de los agentes puede abrir un nuevo camino hacia ese objetivo.

En el futuro, los usuarios quizá no necesiten saber a qué modelo llamar, qué código escribir o qué método de modelado elegir.

Puede que solo tengan que decir:

“Convierte esto en 3D.”

GPT-6 Astra comprenderá la solicitud y decidirá cómo llevarla a cabo.

V2Fun 2.0 aspira a convertirse en la capacidad especializada en la que se apoya para el complejo mundo tridimensional.

GPT-6 Astra se encarga de la comprensión, la planificación y la construcción.

V2Fun convierte las ideas tridimensionales complejas en recursos reales.

GPT-6 Astra × V2Fun: de la generación de código a la colaboración entre modelos.

Preguntas frecuentes

Can GPT-6 Astra generate 3D models?

GPT-6 Astra can support 3D creation by reasoning about scenes, planning asset structure, and generating code. For complex geometry, it can work with V2Fun’s 3D foundation models to generate detailed 3D assets.

How does GPT-6 Astra work with V2Fun for 3D generation?

GPT-6 Astra handles reasoning, planning, code generation, and scene assembly, while V2Fun generates complex 3D geometry. Together, they enable an agent-driven workflow for creating structured 3D scenes.

What is a 3D AI agent?

A 3D AI agent is an AI system that can understand a 3D creation task, plan the required steps, generate or retrieve assets, and assemble them into a complete scene with less manual intervention.

Why use V2Fun instead of generating 3D geometry directly with code?

Code works well for simple procedural geometry, but complex organic or detailed assets are harder to create this way. V2Fun’s 3D foundation models are designed to generate these more complex 3D assets from references or prompts.

Can GPT-6 Astra and V2Fun create 3D models from images?

Yes. In the workflow described here, GPT-6 Astra can analyze a reference image and identify the required assets, while V2Fun can generate complex 3D geometry based on those references.

What can GPT-6 Astra and V2Fun be used to create?

The combined workflow can support complex 3D scenes containing multiple assets, including environments, objects, characters, creatures, and other geometry that would be difficult to generate through code alone.

Artículos relacionados