
Hace unos días OpenAI habilitó GPT-6 Astra y, obviamente, teníamos que probarlo. Pero no queríamos hacer la típica prueba de pedirle que escribiera un texto, resolviera un ejercicio preparado para la ocasión o armara una página web para comprobar que efectivamente podía armar una página web.
Lo importante para esta prueba es que se trata de un proyecto real, con suficiente complejidad como para que durante el desarrollo aparezcan problemas que nosotros no hubiéramos previsto en el prompt.
La propuesta era simple: explicarle qué queríamos construir, establecer algunos requisitos y dejarlo trabajar con la menor intervención posible. Además elegimos deliberadamente GPT-6 Astra Mínimo, la configuración de menor esfuerzo que elegimos para esta prueba. Queríamos empezar por ahí y ver hasta dónde podía llegar antes de necesitar más capacidad o nuestra ayuda.
El experimento comenzó el domingo 13 de septiembre a las 19:45.
¿Qué diferencia hay entre GPT-6 Astra y usar ChatGPT para programar?
Le dimos los requisitos generales del proyecto y una condición adicional: podía delegar tareas sencillas a otros modelos para administrar mejor los recursos, pero debía revisar ese trabajo antes de incorporarlo.
Astra analizó el pedido, propuso una arquitectura, señaló posibles dificultades y dividió el desarrollo en etapas. También fue bastante cuidadoso al diferenciar aquello que había decidido hacer de aquello que realmente había probado.
Hasta ahí, nada nos sorprendió demasiado. Hace tiempo que usamos modelos de IA para trabajar con código y estamos acostumbrados a que puedan analizar requisitos, proponer soluciones y generar buena parte de una aplicación.
La diferencia apareció cuando aprobamos el plan y le dijimos que avanzara.
Normalmente, cuando trabajamos con una IA para programar, seguimos formando parte constante del proceso. Pedimos algo, recibimos código, aparece un problema, explicamos qué queremos cambiar, volvemos a probar y repetimos el ciclo.
Esta vez queríamos comprobar qué pasaba si nosotros dejábamos de conducir.
¿Dónde trabaja GPT-6 Astra y qué puede hacer por su cuenta?
A los pocos minutos Astra empezó a informar que había encontrado algunas herramientas en su entorno, pero que le faltaban otras necesarias para desarrollar Android.
Nuestra primera interpretación fue bastante equivocada: pensamos que estaba revisando qué faltaba instalar en nuestra computadora pero Astra ni siquiera estaba trabajando en nuestra computadora.
Estaba operando dentro de su propio entorno de Work, una máquina aislada en la nube desde la que podía trabajar con archivos, ejecutar comandos y utilizar las herramientas necesarias para completar la tarea. El problema era que esa máquina no estaba preparada específicamente para desarrollar Android.
Así que Astra comenzó a preparar su propio entorno de desarrollo.
Dicho de una manera bastante más sencilla: antes de fabricar la aplicación, tuvo que armarse el taller donde iba a fabricarla.
Para nosotros, ése fue el momento en que la prueba cambió completamente de significado. Ya no estábamos observando solamente un modelo generando código. Estábamos viendo un agente encontrarse con que no tenía los medios necesarios para cumplir el objetivo y ocuparse también de conseguirlos.
¿GPT-6 Astra puede resolver errores sin intervención humana?
Y aparecieron problemas. Algunas de las herramientas que necesitaba no funcionaron como esperaba. Hubo descargas que parecían haberse completado correctamente pero estaban incompletas. También encontró limitaciones en el entorno cuando intentó preparar una forma de ejecutar y comprobar la aplicación.
Lo interesante no fueron esos errores. En desarrollo de software, que aparezcan problemas es prácticamente lo normal. Lo interesante fue qué ocurrió después de cada uno.
Astra comprobó las descargas, detectó cuáles estaban dañadas, buscó alternativas cuando las necesitó y siguió trabajando. Al mismo tiempo había delegado una parte acotada del proyecto a otro modelo y, cuando recibió el resultado, lo revisó antes de incorporarlo. Incluso encontró un caso que necesitaba una corrección y lo ajustó.
Nosotros no tuvimos que indicarle ninguna de esas acciones.
Y ahí encontramos algo que un benchmark difícilmente puede mostrar: el valor del agente no estaba solamente en generar una solución, sino en intentar resolver también los problemas que aparecían entre el pedido y esa solución.
¿Cuánto tarda y cuánto uso consume GPT-6 Astra?

Habíamos comenzado a las 19:45. Poco más de veinte minutos de ejecución después, Astra había preparado gran parte del entorno que necesitaba, desarrollado la primera etapa del proyecto, delegado y revisado parte del trabajo y llegado al proceso de compilación.
Todavía no teníamos una aplicación terminada. Tampoco teníamos un APK instalado y funcionando en un teléfono, así que sería absurdo declarar victoria en este punto.
Pero tampoco habíamos tenido que intervenir para destrabar el desarrollo.
Entonces apareció un problema que Astra no podía resolver: nos quedamos sin cuota de Work.
La ejecución llevaba exactamente 21 minutos y 14 segundos cuando alcanzamos el límite disponible y el trabajo quedó detenido.
Esto no significa que Astra haya consumido cinco horas de cuota en veintiún minutos: no habíamos registrado cuánto uso quedaba antes de comenzar. Es algo que vamos a medir mejor en la próxima sesión. Lo que sí sabemos es que el límite se agotó mientras Astra seguía trabajando y que, en ese momento, nuestra cuota semanal todavía tenía un 84 % disponible.
Este dato también forma parte de la prueba. Un agente capaz de trabajar durante períodos prolongados, ejecutar herramientas y delegar tareas puede ser mucho más útil que una conversación tradicional con un modelo, pero esa autonomía también consume recursos, y queremos saber cuánto.
¿Puede GPT-6 Astra crear una app Android completa?
Por ahora no sabemos si Astra puede terminar la aplicación. Y justamente por eso todavía no queremos sacar conclusiones.
No queremos escribir una review basada en una demostración cuidadosamente elegida ni concluir que una herramienta es extraordinaria porque consiguió generar código durante veinte minutos. Queremos seguir el proyecto hasta obtener algo que podamos probar fuera del entorno de Astra.
Cuando se restablezca nuestra cuota vamos a volver al mismo trabajo y darle una única instrucción: Continuá.
Si finalmente genera el APK, vamos a instalarlo en un teléfono Android real. Ahí tendremos una prueba mucho menos discutible: veremos si abre, si funciona y si realmente hace aquello que pedimos.
También podremos medir algo que para nosotros es todavía más interesante: cuánta intervención humana hizo falta para pasar de una idea a una aplicación funcionando.
Después de estos primeros 21 minutos todavía no tenemos esa respuesta. Pero sí apareció una primera diferencia bastante clara respecto de nuestra forma habitual de trabajar con IA.
Nosotros definimos qué queríamos construir. Astra empezó a ocuparse del cómo. Incluso cuando para hacerlo primero tuvo que construirse su propio taller.
Continuará…
