5 de septiembre de 2026

GPT-6 Astra para desarrolladores: el precipicio de precio que nadie puso en el titular

Foto de Marco Orta Marco Orta | 14 min de lectura
Compartir
Una barra ancha de tokens avanzando hacia un escalón marcado en el camino, donde el riel de precio salta a un segundo nivel y la barra sigue al doble de altura
Tabla de Contenidos

    OpenAI lanzó GPT-6 Astra el 3 de septiembre de 2026 con una ventana de contexto de 1,050,000 tokens. Lo que la cobertura del lanzamiento se saltó: en el momento en que una petición pasa de 272,000 tokens de entrada, se recobra la petición completa al doble de entrada y 1.5x de salida. No el excedente — todo. Un token después de la línea prácticamente duplica la cuenta de esa llamada. La ventana que te venden es la ventana que te cobran al doble por usar.

    Esa es la primera de cinco cosas que importan si eres quien escribe el código y no quien lee la gráfica de benchmarks. Este post es la lectura del lado del desarrollador: precios, restricciones de acceso, lo que Astra explícitamente no soporta, el parámetro que te va a romper la validación y —la que más me importa por la gente que me escribe— por qué Astra es el destino equivocado para los modelos que OpenAI apaga el 23 de octubre.

    Qué es Astra de verdad, en una sola tabla

    GPT-6 Astra
    ID del modelo en la APIgpt-6-astra (un solo snapshot)
    Ventana de contexto1,050,000 tokens
    Entrada máxima922,000 tokens
    Salida máxima128,000 tokens
    Corte de conocimiento30 de abril de 2026
    Entrada / salida$10 / $50 por millón
    Entrada en caché / escritura de caché$1.00 / $12.50 por millón
    Batch y Flex50 % de la tarifa estándar
    Modo Fast2x estándar, hasta ~2.5x de velocidad
    Arriba de 272K de entrada2x entrada y caché, 1.5x salida — sobre la petición completa
    Esfuerzo de razonamientolow, medium, high, xhigh, max
    EndpointsChat Completions, Responses, Batch
    No soportaRealtime, Assistants, fine-tuning, embeddings, generación de imágenes, audio, moderación, Completions legacy

    La disponibilidad va por etapas: primero un grupo limitado de organizaciones (los programas Daybreak y Trusted Access de OpenAI), después ChatGPT Plus, Pro, Business y Enterprise “en los próximos días”, y luego la API y Amazon Bedrock. Los espacios de Enterprise lo traen apagado por defecto — un administrador tiene que prenderlo, que va a ser el primer ticket de soporte que levante tu equipo.

    1. El precipicio de los 272K, con la aritmética

    Esta es la parte que conviene interiorizar antes de conectar Astra a cualquier cosa que corra en bucle.

    El recargo no es precio marginal. No es “los tokens arriba de 272K cuestan el doble”. Según la propia página del modelo de OpenAI, los prompts arriba de 272,000 tokens de entrada se cobran a 2x las tarifas de entrada y caché y 1.5x la de salida sobre la petición completa. Lo que produce esto:

    PeticiónTokens de entradaTokens de salidaCosto entradaCosto salidaTotal
    Justo debajo272,0008,000$2.72$0.40$3.12
    Justo arriba273,0008,000$5.46$0.60$6.06
    Entrada máxima922,0008,000$18.44$0.60$19.04
    Entrada y salida máximas922,000128,000$18.44$9.60$28.04

    Mil tokens extra de entrada —un archivo mediano, un par de resultados de herramienta— convierten una llamada de $3.12 en una de $6.06. Es un aumento del 94 % por un aumento del 0.4 % en la entrada.

    Ahora mete eso en un bucle de agente. Los agentes no mandan un prompt grande: acumulan. El contexto crece con cada resultado de herramienta, cada archivo leído, cada reintento. Así que un agente que arranca cada sesión cómodamente debajo de la línea va a cruzarla en silencio como a la segunda hora de una refactorización larga — y cada llamada siguiente de esa sesión se cobra del lado caro. No truena nada. No te avisa nada. Te enteras en la factura.

    Si alguna vez mediste lo que quema un agente de verdad, ya conoces la forma del problema: en 35 días de Claude Code registré 7,970 millones de tokens facturables. Aplícale una función escalón de 2x a una curva así y el número deja de ser teórico.

    Qué hacer de verdad:

    • Pon un techo duro de entrada debajo de la línea, no en la línea. 260,000 deja espacio para el resultado de herramienta que no anticipaste. Imponlo en tu propio código antes de la llamada, porque la API no lo va a hacer por ti.
    • Cuenta antes de mandar. Contar tokens es barato y el precipicio no. Si tu stack todavía no mide la entrada por petición, esa es la instrumentación que va primero.
    • Acuérdate de que el caché de prompts está del mismo lado del precipicio. La entrada en caché son $1/M normalmente y $2/M pasando 272K. El caché suaviza la pendiente, no mueve el escalón.
    • Usa Batch donde la latencia lo permita. El 50 % de descuento aplica antes del multiplicador, así que batch con contexto largo sigue saliendo más barato que estándar con contexto largo.

    Antes de mandar una plantilla de prompt a producción, revisa su tamaño. El precipicio es un número alrededor del cual puedes diseñar — pero solo si sabes de qué lado estás.

    2. Las restricciones de acceso son reales, y pegan en trabajo no relacionado

    Astra es el primer modelo que OpenAI clasifica en nivel Crítico de capacidad en ciberseguridad bajo su Preparedness Framework. En las propias palabras llanas de OpenAI: con las herramientas y el acceso correctos, puede encontrar fallas de seguridad desconocidas hasta ahora y desarrollar nuevas formas de explotarlas en muchos sistemas bien protegidos, sin que una persona guíe cada paso. Durante la evaluación desarrolló exploits para navegadores y sistemas operativos endurecidos, y encontró dos vulnerabilidades de V8 que nadie conocía.

    La consecuencia para quien desarrolla no es abstracta:

    • El acceso estándar de la API rechaza de plano el trabajo avanzado de ciberseguridad. El descubrimiento y desarrollo de exploits no queda “en pausa para revisión” — se rechaza.
    • La capacidad avanzada está detrás de Daybreak y Trusted Access. Si haces trabajo legítimo de seguridad defensiva, aplicas; no basta con pagar.
    • Las cuentas fuera de esos programas pueden toparse con lentitud, pausas o bloqueos, y según los reportes “a veces durante trabajo no relacionado”. Esa última parte es la operativamente importante. Un clasificador de seguridad calibrado para una capacidad de nivel Crítico va a tener falsos positivos, y los falsos positivos sobre una llamada síncrona a la API son picos de latencia y peticiones fallidas dentro de tu producto.

    Si vas a poner Astra detrás de una función que ve el usuario, constrúyelo para eso: timeouts, un modelo de respaldo y una ruta de reintento que degrade a un modelo más chico en lugar de sacar un error. Trata “la capa de seguridad dijo que no” como un modo de falla normal con su propia rama de código, no como una excepción que registras y olvidas.

    Hay una segunda señal que vale leer con honestidad en vez de descartarla. La evaluación del AI Safety Institute del Reino Unido encontró comportamiento de ataque a la cadena de suministro en 2 de 500 corridas muestreadas, y la propia OpenAI apunta una caída sustancial en la monitoreabilidad de la cadena de razonamiento frente a modelos anteriores — es decir, el modelo puede completar tareas sin exponer su razonamiento. Si vas a correr Astra con acceso a shell dentro de CI, approval_policy = "never" ya no es un valor por defecto defendible. Es el mismo argumento que hice sobre revisar el código escrito por IA antes de que llegue a producción, solo que ahora el radio de daño incluye tu pipeline de build.

    3. Lo que no soporta (la trampa del reemplazo directo)

    Astra es un modelo de razonamiento, uso de computadora y contexto largo. No es un reemplazo general de tu cuenta de OpenAI. La lista de lo que no soporta es larga y específica:

    Realtime. Assistants. Fine-tuning. Embeddings. Generación de imágenes. Audio. Moderación. Completions legacy.

    Dos de esos merecen mención aparte porque cargan peso en sistemas reales:

    • Sin fine-tuning. Si tu producto depende de un modelo afinado, Astra no es un camino hacia adelante para él, y OpenAI además cierra la creación de nuevos trabajos de fine-tuning autoservicio el 6 de enero de 2027. Esos dos hechos juntos son una decisión de estrategia, no un cambio de configuración.
    • Sin embeddings. El paso de embeddings de tu pipeline de RAG se queda donde está. Astra cambia la mitad de generación de RAG y nada de la mitad de recuperación — y con una ventana de un millón de tokens, la pregunta más interesante es si partes de tu capa de RAG ya están resolviendo un problema que dejaste de tener. (Con los precios de arriba: probablemente no. Recuperar sigue siendo más barato que rellenar.)

    4. xhigh y max: el parámetro que rompe tu validación

    Astra agrega dos niveles de esfuerzo de razonamiento arriba de high: xhigh y max. Cinco en total, en orden: low, medium, high, xhigh, max.

    Es un cambio chico con filo. Si en cualquier punto de tu stack validas reasoning_effort contra un enum quemado, una unión de TypeScript, un Literal de Pydantic, un esquema de Zod, un enum de JSON Schema o una restricción CHECK en base de datos — esa validación ahora rechaza valores válidos. La falla ocurre en tu capa, no en la de OpenAI, que es justo el tipo de ruptura que cuesta una tarde encontrar porque el mensaje de error apunta a tu propio código y parece un bug que tú metiste.

    // Antes
    type ReasoningEffort = 'low' | 'medium' | 'high';
    
    // Después
    type ReasoningEffort = 'low' | 'medium' | 'high' | 'xhigh' | 'max';
    

    Busca la cadena 'high' junto a reasoning en tu código y en tu configuración de infraestructura antes de dejar que alguien seleccione Astra en un selector de modelos.

    Sobre el costo: los tokens de razonamiento son tokens de salida, facturados a $50/M (o $75/M pasando el precipicio). max sobre una petición de contexto largo es la combinación más cara que existe hoy en la API. Resérvala para la decisión de arquitectura o la sesión de depuración que ya se comió un día — no para el valor por defecto de un archivo de configuración que nadie vuelve a mirar.

    5. Las notas de contexto reemplazan la compactación — y eso cambia el comportamiento del agente

    Este es el cambio que me parece genuinamente subestimado, y no es un número de benchmark.

    Todo agente de larga duración pega contra la misma pared: el contexto se llena y el harness compacta — resume la conversación en una más corta y sigue. La compactación pierde información y la pérdida es irreversible. El texto exacto del error del tercer intento fallido, el enfoque que abandonaste y por qué, la aserción específica que se rompió: todo eso se aplana en “probamos varios enfoques para arreglar el bug de autenticación”. Y entonces el agente vuelve a intentar el enfoque abandonado, porque nada en su contexto dice que ya falló.

    Astra reemplaza eso con notas persistentes más ventanas de contexto anteriores consultables. Mantiene notas corridas entre ventanas, y puede regresar a buscar en ventanas previas algo que la nota no alcanzó a capturar. En la práctica: el modelo puede recuperar un requisito o el resultado de una prueba de hace dos horas aunque en su momento no se le haya ocurrido anotarlo.

    En Codex CLI (v0.153.1 o posterior, publicada el 3 de septiembre de 2026) la configuración es:

    model = "gpt-6-astra"
    model_provider = "openai"
    model_reasoning_effort = "high"
    
    # Deja que las notas de Astra hagan el trabajo en vez de la compactación de Codex
    auto_compact_token_limit = 850000
    
    [tui]
    auto_recap = false
    

    Por sesión: codex -m gpt-6-astra --reasoning-effort xhigh "tu tarea", o /model gpt-6-astra a media sesión. Corre codex models para confirmar que tu cuenta sí tiene acceso — el selector solo muestra lo que tu cuenta tiene habilitado, así que un modelo ausente es una respuesta sobre permisos, no un bug.

    Fíjate en la tensión con la sección 1: auto_compact_token_limit = 850000 deja deliberadamente que el contexto corra muy por arriba de 272K, porque de eso se trata la función. Estás cambiando dinero por continuidad. Es un intercambio defendible para una sesión de depuración difícil e indefendible para un chatbot.

    6. Leer los benchmarks con honestidad

    El marcador, con las comparaciones que se publicaron junto a él:

    BenchmarkGPT-6 AstraGPT-5.6 SolClaude Opus 5Claude Fable 5.1
    OSWorld 2.0 (uso de computadora)72.6 %65.7 %70.2 %
    Terminal-Bench 4.057.7 %37.3 %52.3 %55.8 %
    FrontierMath Tier 4 v297.6 %83.0 %73.2 %87.8 %
    GPQA Diamond96.0 %94.6 %93.7 %93.7 %
    ExploitBench100 %78.5 %70.0 %
    Humanity’s Last Exam (con herramientas)57.2 %63.6 %65.0 %
    DeepSWE v1.1 (programación)74.1 %72.7 %

    Tres lecturas honestas:

    1. La ganancia en uso de computadora es la noticia real. 72.6 % en OSWorld con el tiempo de completar tareas cayendo de ~75 minutos a ~40 es un cambio de escalón en lo que un agente puede terminar sin supervisión. Si tu caso de uso es “opera un navegador, una hoja de cálculo y una terminal para completar un trabajo de varios pasos”, esto es otra clase de herramienta.
    2. La ganancia en programación es marginal. 74.1 % contra 72.7 % en DeepSWE está dentro del ruido de una tabla donde Gemini 3.8 Flash y Claude Opus 5 viven en la misma banda. Si estás eligiendo modelo para escribir código, Astra no es la respuesta evidente, y a $10/$50 tampoco es la respuesta barata.
    3. El número de ARC-AGI-3 está haciendo trabajo de marketing. El 99.9 % del titular sale de un harness adaptador. Las llamadas sin estado a la API —que es lo que hace tu código— reportan entre 17 % y 63 % según el nivel de razonamiento. Cualquier benchmark citado con un harness propio es una afirmación sobre el harness tanto como sobre el modelo.

    Astra también queda debajo de Claude Fable 5.1 en Humanity’s Last Exam con herramientas (57.2 % contra 65.0 %). “El modelo más capaz jamás desplegado” es una afirmación defendible en agregado; no es cierta en todos los ejes, y los ejes donde no lo es incluyen razonamiento con herramientas, que es lo que hacen los agentes todo el día.

    La parte que de verdad necesita la mayoría: el 23 de octubre

    Aquí es donde el ruido del lanzamiento choca con la fecha real.

    El 23 de octubre de 2026 OpenAI apaga gpt-3.5-turbo, gpt-4, gpt-4-turbo, o1, o1-pro, o3-mini y o4-mini en la API. Después de esa fecha, las llamadas a esos IDs devuelven errores, no respuestas. Ese es el cambio con ruptura que tienes en el calendario, y está a 48 días de este post.

    El lanzamiento de Astra va a empujar a mucha gente a migrar directo hacia él. Para la mayoría eso es un error caro.

    Lo típico conectado a gpt-3.5-turbo es un chatbot de soporte o un clasificador construido en 2023. gpt-3.5-turbo cerró con un precio publicado de alrededor de $0.50 por millón de entrada y $1.50 por millón de salida. Astra son $10 y $50. Eso es 20 veces el costo de entrada y 33 veces el de salida — para una carga que se eligió precisamente porque era la barata. Migrar un clasificador de alto volumen de gpt-3.5 a Astra no lo moderniza: convierte una línea de $40 al mes en algo que sí vas a notar.

    La escalera de migración que sí tiene sentido:

    • Chatbot o clasificador en gpt-3.5-turbo el nivel small/mini actual. Más barato que lo que traes, y muchísimo más capaz. Astra ni entra en la conversación.
    • Carga general en gpt-4 / gpt-4-turbo el nivel medio actual. Prueba regresiones de prompt; una década de folclore de prompt engineering se afinó contra las manías específicas de gpt-4.
    • Carga de razonamiento en o1 / o3-mini / o4-mini aquí Astra sí es candidato genuino, porque ya aceptaste el costo de tokens de razonamiento. Mide con high antes de irte a xhigh.
    • Agente de horizonte largo que opera software → Astra, y este es el caso para el que se construyó. Presupuesta lo de la sección 1.

    El calendario completo, la consulta de auditoría para saber si estás expuesto y la lista de migración están en el calendario de apagones de modelos de IA de 2026 — incluidas las dos fechas de septiembre que caen antes de que Astra siquiera esté disponible en general: la Videos API y sora-2 se retiran el 24 de septiembre, y los snapshots legacy el 28.

    Entonces, ¿te cambias?

    Traes un chatbot, un clasificador o cualquier cosa de alto volumen y contexto corto: no. Astra es la clase de precio equivocada. Vete al nivel chico, y vete antes del 23 de octubre.

    Traes un agente de programación: no con estos números solos. La diferencia en programación contra la generación anterior es marginal y el precio no. Pruébalo en las tareas difíciles —las que hoy fallan— y deja el modelo más barato como predeterminado.

    Traes un agente de horizonte largo que maneja un navegador, una terminal o un escritorio: sí, y es la única categoría donde la respuesta es un sí directo. El salto en OSWorld y la arquitectura de notas persistentes apuntan exactamente a ti. Pon el techo de tokens primero.

    Haces trabajo de seguridad defensiva: sí, y empieza ya la solicitud a Trusted Access, porque la API estándar va a rechazar justo el trabajo para el que la necesitas.

    Tienes algo afinado con fine-tuning: Astra no es tu camino. Planea eso aparte, con la fecha de enero de 2027 en la misma hoja.

    Para seguir leyendo:

    Preguntas frecuentes

    ¿Cuánto cuesta la API de GPT-6 Astra?

    El precio estándar es de 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida, con la entrada en caché a 1 dólar por millón y las escrituras de caché a 12.50 por millón. El procesamiento Batch y Flex corre al 50 % de la tarifa estándar, y el modo Fast cuesta el doble del estándar a cambio de hasta 2.5 veces la velocidad. Lo crítico: cualquier petición con más de 272,000 tokens de entrada se factura al doble de las tarifas de entrada y caché y a 1.5 veces la de salida sobre la petición completa, no solo sobre los tokens que pasan el umbral.

    ¿Cuál es la ventana de contexto de GPT-6 Astra?

    La ventana de contexto es de 1,050,000 tokens, con un máximo de 922,000 tokens de entrada y 128,000 de salida en una sola petición. El corte de conocimiento es el 30 de abril de 2026. Ten en cuenta que usar más de 272,000 tokens de entrada dispara un recargo que aplica a la petición completa, así que la ventana usable y la ventana económicamente sensata no son el mismo número.

    ¿Por qué no veo gpt-6-astra en mi cuenta?

    El acceso va por etapas. En el lanzamiento Astra llegó a un grupo limitado de organizaciones dentro de los programas Daybreak y Trusted Access de OpenAI, después a los usuarios de ChatGPT Plus, Pro, Business y Enterprise, y luego a la API y a Amazon Bedrock. Los espacios de Enterprise lo traen deshabilitado por defecto y un administrador tiene que activarlo. En Codex CLI, ejecutar "codex models" muestra solo lo que tu cuenta tiene habilitado, así que un modelo ausente normalmente significa restricción de acceso y no un bug.

    ¿Puedo usar GPT-6 Astra para investigación de seguridad o pruebas de penetración?

    No a través del acceso estándar de la API. Astra es el primer modelo que OpenAI clasifica en nivel Crítico de ciberseguridad bajo su Preparedness Framework, y el acceso estándar rechaza de plano el trabajo avanzado de ciberseguridad, como el descubrimiento de exploits, en lugar de pausarlo para revisión. La capacidad avanzada está detrás de los programas Daybreak y Trusted Access. Las cuentas fuera de esos programas también pueden ver lentitud, pausas o bloqueos, según los reportes a veces durante trabajo no relacionado.

    ¿GPT-6 Astra soporta fine-tuning?

    No. Astra soporta Chat Completions, Responses y Batch, y no soporta fine-tuning, Realtime, Assistants, embeddings, generación de imágenes, audio, moderación ni el endpoint legacy de Completions. Esto importa junto a otro cambio de OpenAI: la creación de nuevos trabajos de fine-tuning autoservicio cierra el 6 de enero de 2027, así que cualquier producto que dependa de un modelo afinado necesita un plan que no pase por Astra.

    ¿Debo migrar mi chatbot de gpt-3.5-turbo a GPT-6 Astra antes del 23 de octubre de 2026?

    Casi seguro que no. gpt-3.5-turbo se apaga el 23 de octubre de 2026 junto con gpt-4, gpt-4-turbo, o1, o1-pro, o3-mini y o4-mini, así que sí tienes que moverte. Pero gpt-3.5-turbo cerró con un precio publicado de alrededor de 0.50 dólares por millón de entrada y 1.50 por millón de salida, contra los 10 y 50 de Astra: unas 20 veces el costo de entrada y 33 veces el de salida. Las cargas de alto volumen y contexto corto, como chatbots y clasificadores, pertenecen al nivel small o mini actual, que es a la vez más barato que gpt-3.5-turbo y bastante más capaz.

    ¿Qué son los niveles de razonamiento xhigh y max?

    Astra agrega dos niveles arriba de high, para un total de cinco: low, medium, high, xhigh y max. Cualquier código que valide reasoning_effort contra una lista quemada —una unión de TypeScript, un esquema de Zod o Pydantic, un enum de JSON Schema, una restricción de base de datos— va a rechazar los valores nuevos hasta que se actualice, y el error resultante parece venir de tu propio código. Los tokens de razonamiento se facturan como tokens de salida, así que max sobre una petición de contexto largo es la combinación más cara que ofrece la API hoy.

    ¿Qué son las notas de contexto y en qué se diferencian de la compactación?

    La compactación resume una conversación completa en una más corta cuando se llena la ventana de contexto, lo que pierde de forma irreversible detalles como mensajes de error exactos o enfoques que se probaron y se abandonaron. Astra en cambio mantiene notas persistentes entre ventanas de contexto y deja consultables las ventanas anteriores, así que puede recuperar un requisito o el resultado de una prueba de una ventana previa incluso cuando la nota no lo capturó. En Codex CLI v0.153.1 o posterior esto se configura subiendo auto_compact_token_limit para que las notas de Astra se encarguen de la continuidad en vez de que el harness compacte antes de tiempo.

    Compartir

    Buscar

    Etiquetas

    PHP IA Migración Laravel Tutorial JavaScript Desarrollo Web Buenas Prácticas Upgrade Seguridad Laravel 13 OpenAI Backend SEO Claude