Claude Opus 5.5 llegó el 22 de septiembre de 2026 y, por una vez, lo interesante no está en la tabla de benchmarks. Está en la factura. Anthropic ha puesto su modelo más capaz a 4 dólares por millón de tokens de entrada y 20 de salida, un 20 % por debajo de Opus 5 y un 60 % por debajo de Claude Fable 5.1, mientras gana en las nueve pruebas que la propia compañía publica. Hemos revisado los números uno a uno, los hemos puesto en gráficos y hemos separado lo que se puede comprobar de lo que es marketing.
Qué ha lanzado Anthropic exactamente
Opus 5.5 es una revisión intermedia, no una generación nueva. El identificador de modelo es claude-opus-5-5 y está disponible desde el primer día en las aplicaciones de Claude, en la API, en Claude Code, en Claude Cowork y en las tres nubes grandes: Amazon Web Services, Google Cloud y Microsoft Azure. No hay lista de espera ni despliegue por regiones.
El resumen que hace Anthropic es corto: rinde al nivel de Claude Fable 5.1 en la mayoría de los trabajos, cuesta alrededor de un 40 % menos de operar que Opus 5 y genera texto más de un 30 % más rápido. Y hay una frase que conviene retener, porque la escribe la propia compañía debajo de su tabla de resultados: a estos niveles de capacidad, los márgenes de los benchmarks se han vuelto una guía cada vez menos fiable de las diferencias reales.
Esa advertencia es honesta y es el motivo por el que este análisis no se queda en los porcentajes.
Programación agéntica: Opus 5.5 frente a Fable 5.1 y Opus 5
Porcentaje de tareas resueltas en las tres pruebas de programación que Anthropic publicó el 22 de septiembre de 2026.
- Claude Opus 5.5
- Claude Fable 5.1
- Claude Opus 5
Ver los datos en tabla
| Dato | Claude Opus 5.5 | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 66,4% | 55,8% | 52,3% |
| FrontierCode v1.1 | 54,4% | 50,3% | 48,0% |
| CursorBench 4.0 | 57,8% | 51,8% | 46,6% |
Los números: nueve pruebas, nueve victorias
Anthropic publicó nueve benchmarks comparando Opus 5.5 con Fable 5.1, con Opus 5 y, donde había datos, con los modelos de OpenAI. Opus 5.5 gana en las nueve frente a los dos modelos de la casa. Las tres primeras miden programación agéntica, que es el terreno donde Anthropic lleva dos años apostando fuerte.
Terminal-Bench 4.0 mide si el modelo resuelve tareas completas dentro de una terminal: instalar dependencias, leer errores, reintentar. Pasar del 52,3 % de Opus 5 al 66,4 % son catorce puntos, y en una prueba de este tipo cada punto es una tarea que antes se quedaba a medias. FrontierCode v1.1 y CursorBench 4.0 miden trabajo sobre repositorios reales; ahí las mejoras son de seis y once puntos.
El segundo bloque es más heterogéneo y por eso va en su propio gráfico. Mezcla razonamiento con herramientas (Humanity's Last Exam), ciencia en terminal, uso del ordenador con ratón y teclado (OSWorld 2.0), lectura de gráficos (Chartography) y automatización de tareas de oficina.
Razonamiento, uso del ordenador y trabajo de oficina
Humanity's Last Exam y Chartography se miden con herramientas; OSWorld 2.0 puntúa aciertos parciales.
- Claude Opus 5.5
- Claude Fable 5.1
- Claude Opus 5
Ver los datos en tabla
| Dato | Claude Opus 5.5 | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|
| Humanity's Last Exam | 67,7% | 65,6% | 63,6% |
| Terminal-Bench-Science 0.1 | 58,7% | 52,6% | 29,0% |
| OSWorld 2.0 | 81,8% | 80,7% | 74,0% |
| Chartography | 89,0% | 88,4% | 83,4% |
| AutomationBench | 40,0% | 31,4% | 26,9% |
Hay un dato que salta a la vista: Terminal-Bench-Science pasa de 29,0 % a 58,7 %. Duplicar un resultado entre dos versiones del mismo modelo no es normal, y lo más probable es que refleje un cambio en cómo el modelo maneja las herramientas más que un salto de inteligencia bruta. En el resto de pruebas de este bloque las diferencias con Fable 5.1 son de uno o dos puntos, que es exactamente el rango del que Anthropic dice que no hay que fiarse.
Conviene tener presente dónde no gana. En AutomationBench, GPT-6 Astra saca 41,4 % frente al 40,0 % de Opus 5.5, y en Terminal-Bench-Science la diferencia es mucho mayor: 64,6 % contra 58,7 %. Anthropic publica esas dos derrotas en su propia tabla, lo cual dice algo bueno de la tabla.
GDPval-AA: la prueba que mide trabajo, no exámenes
De todas las cifras del lanzamiento, la que más nos interesa es GDPval-AA v2.1, porque no es un test de preguntas: son encargos profesionales completos evaluados por personas del oficio. Se puntúa en Elo, el mismo sistema del ajedrez, lo que significa que las diferencias se leen como probabilidad de ganar una comparación, no como porcentaje de aciertos.
GDPval-AA v2.1: puntuación Elo en tareas de trabajo real
GDPval mide encargos profesionales completos, no ejercicios de examen. Se puntúa en Elo, así que va en su propia escala.
Ver los datos en tabla
| Dato | Elo |
|---|---|
| Opus 5.5 | 1 846 |
| Fable 5.1 | 1 735 |
| Opus 5 | 1 708 |
| GPT-5.6 Sol | 1 588 |
| GPT-6 Astra | 1 542 |
Opus 5.5 marca 1846 puntos, 111 por encima de Fable 5.1 y 138 por encima de Opus 5. Como referencia mental: unos 100 puntos de Elo equivalen a ganar aproximadamente dos de cada tres comparaciones directas. Es una ventaja clara, pero no es la diferencia entre acertar y fallar; es la diferencia entre entregar un trabajo que se aprueba a la primera y uno que necesita una vuelta.
Elo y porcentaje no se pueden mezclar en el mismo gráfico. Por eso GDPval va aparte: un eje, una escala, una lectura. Cualquier gráfico que ponga 1846 y 66,4 % en el mismo eje está mintiendo con la forma.
El precio es la noticia de verdad
Aquí es donde el lanzamiento deja de ser rutinario. La tarifa estándar de Opus 5.5 es de 4 dólares por millón de tokens de entrada y 20 por millón de salida. Opus 5 costaba 5 y 25. Fable 5.1 cuesta 10 y 50.
Precio de la API por millón de tokens
Tarifa estándar de los tres modelos. El modo rápido de Opus 5.5 cuesta el doble: 8 y 40 dólares.
- Opus 5.5
- Opus 5
- Fable 5.1
Ver los datos en tabla
| Dato | Opus 5.5 | Opus 5 | Fable 5.1 |
|---|---|---|---|
| Entrada | 4 $ | 5 $ | 10 $ |
| Salida | 20 $ | 25 $ | 50 $ |
Traducido: el modelo que gana todas las pruebas cuesta la quinta parte que el modelo que hasta ayer era el techo de la casa. Y la caché baja todavía más de lo que sugiere el gráfico, porque la lectura de caché pasa de 0,50 a 0,20 dólares por millón, un 60 % menos. Para cualquier agente que arrastre el mismo contexto durante horas, la caché es la mitad de la factura.
Cuidado con el 40 %
Anthropic dice que Opus 5.5 cuesta «un 40 % menos» que Opus 5, pero la tarifa solo baja un 20 %. No es una contradicción: el 40 % se refiere a cargas de trabajo típicas, donde además del precio por token influye cuántos tokens hace falta gastar. El modelo piensa de forma adaptativa y, según la compañía, alcanza con esfuerzo medio lo que Opus 5 necesitaba en esfuerzo máximo. Menos tokens de razonamiento por tarea, más barato el token, y de ahí sale el 40 %.
La diferencia importa a la hora de presupuestar. Si tu carga es de entrada larga y salida corta —clasificar documentos, extraer datos—, notarás el 20 % y poco más. Si tu carga es agéntica y el modelo razona mucho antes de actuar, es donde puede aparecer el 40 %.
Modo rápido: cuándo compensa pagar el doble
Opus 5.5 mantiene el modo rápido, que multiplica la velocidad hasta por 2,5 a cambio de duplicar la tarifa: 8 dólares de entrada y 40 de salida. La cuenta es sencilla y casi siempre da el mismo resultado.
- Compensa cuando hay una persona esperando delante de la pantalla: un asistente de código que completa mientras escribes, un chat de atención al cliente, una demo en directo. Ahí el tiempo de espera es el producto.
- No compensa en procesos por lotes, trabajos nocturnos, generación de informes o cualquier tarea que nadie está mirando mientras ocurre. Pagar el doble por terminar a las 3:10 en vez de a las 3:25 de la madrugada no tiene sentido.
- Depende en agentes de larga duración. Si el agente encadena veinte pasos y cada uno espera al anterior, la velocidad se acumula; si los pasos van en paralelo, no.
Una regla práctica que nos funciona: usar modo estándar por defecto y activar el rápido solo en las rutas donde un humano mira la pantalla. Se configura por petición, no por cuenta, así que no hay que elegir de una vez para siempre.
Esfuerzo adaptativo: el parámetro que decide tu factura
El control de esfuerzo no es nuevo —ya estaba en Opus 5—, pero en 5.5 cambia de naturaleza. Antes elegías cuánto querías que pensara; ahora el modelo ajusta el razonamiento a la dificultad de lo que le pides dentro del límite que le marcas. El nivel por defecto es medio, y es el que Anthropic compara con el máximo de Opus 5.
En la práctica esto significa tres cosas:
- Si venías con esfuerzo alto o máximo en Opus 5 «por si acaso», probablemente puedas bajar un escalón y quedarte igual.
- El coste por tarea deja de ser predecible en el sentido antiguo: dos preguntas parecidas pueden gastar muy distinto si una es más difícil. Hay que medir sobre tu tráfico real, no sobre un ejemplo.
- El modo de pensamiento ya no se puede desactivar. Si tu código dependía de apagarlo para ahorrar, ese ahorro ya no existe y hay que rehacer la cuenta.
Lo desarrollamos paso a paso en nuestro tutorial de niveles de esfuerzo y modo rápido de Opus 5.5, con las llamadas concretas y cómo medir el gasto antes de dejarlo en producción.
Seguridad: la auditoría que Anthropic destaca
Anthropic afirma que Opus 5.5 es el modelo que mejor ha puntuado en su auditoría automatizada de comportamiento, la evaluación de alineamiento más completa que ejecutan, con cerca de 2.000 escenarios. El dato concreto que dan: intenta sortear los límites que se le ponen un 85 % menos de veces que Opus 5.
Son cifras de la propia compañía sobre su propia prueba, así que hay que leerlas como lo que son. Lo que sí es verificable y tiene consecuencias prácticas: el modelo mantiene la opción de retención cero de datos, incorpora marcado de agua conforme al Reglamento de IA de la Unión Europea y conserva el pensamiento sin exponerlo en crudo, una protección contra la destilación por terceros.
Ese último punto conecta con un tema que ya tratamos en Arkaia: el aviso de la NSA, CISA y el FBI sobre destilación de modelos estadounidenses. Guardar la cadena de razonamiento no es una decisión estética.
Escribe distinto, y eso se nota antes que los benchmarks
El cambio que más rápido va a percibir quien use Claude a diario no aparece en ninguna tabla. Anthropic dice que Opus 5.5 pone primero lo importante, usa menos jerga y sigue las instrucciones de estilo con más fidelidad. En sus pruebas con usuarios tempranos, el texto resultó «más claro y más fácil de entender».
Es una respuesta directa a una queja vieja: el tono reconocible de Claude, con sus rodeos, sus listas de tres puntos y sus advertencias constantes. Si escribes con el modelo —documentación, correos, informes—, merece la pena volver a probar tus prompts de sistema: algunos de los trucos que usábamos para domar el estilo ahora sobran y pueden estorbar.
¿Merece la pena cambiar? Tres perfiles
Si venías de Opus 5
Cambia. No hay ningún escenario en el que Opus 5 salga mejor parado: gana menos en todas las pruebas publicadas y cuesta un 25 % más por token. Lo único que hay que revisar antes de tocar producción es el código que desactivaba el pensamiento y los presupuestos de esfuerzo fijados a mano.
Si venías de Fable 5.1
Depende de para qué. Si Fable estaba ahí por sus capacidades de escritura larga o por tareas muy específicas donde lo tenías medido, mide otra vez antes de mover nada: las diferencias de uno o dos puntos en los benchmarks no predicen tu caso. Si Fable estaba ahí porque era el modelo más capaz y punto, Opus 5.5 hace lo mismo por la quinta parte.
Si estás empezando
Opus 5.5 con esfuerzo medio y modo estándar es el punto de partida razonable, y desde ahí se ajusta. Si te preocupa el coste antes de saber cuánto vas a gastar, nuestra comparativa de alternativas a ChatGPT pone las opciones en contexto, incluidas las de código abierto.
La otra mitad de la ecuación: lo que pasa en tu máquina
Un detalle que se pierde en los titulares: por mucho que baje el precio de la API, buena parte del trabajo real con estos modelos ocurre en tu ordenador. Un agente que compila, ejecuta pruebas y arranca contenedores gasta tu CPU, tu RAM y tu disco, no los de Anthropic. Y si además ejecutas modelos en local para las tareas que no compensa enviar a la nube, el cuello de botella es la VRAM, como explicamos en la guía de modelos de IA local según la VRAM.
Estos son los componentes que de verdad marcan diferencia en un flujo de trabajo con agentes, con enlaces para consultar disponibilidad. Son recomendaciones editoriales; el precio lo ves en Amazon, que cambia cada semana.
Memoria y disco: lo primero que se queda corto
Un agente que abre veinte pestañas de contexto, un contenedor de pruebas y el navegador se come 32 GB sin despeinarse. Saltar a 64 GB de DDR5 es la mejora más barata por euro que existe hoy en una máquina de desarrollo: Crucial Pro DDR5 64 GB (2×32 GB) a 6000 MHz, ver disponibilidad en Amazon.
Con el disco pasa parecido. Compilar y reinstalar dependencias cien veces al día castiga el SSD más que cualquier juego: Samsung 990 EVO Plus de 2 TB, ver precio actual en Amazon. Si quieres el contexto completo de qué unidad elegir, tenemos la comparativa de SSD NVMe Gen5.
Gráfica: solo si ejecutas modelos en local
Para hablar con la API de Anthropic no necesitas gráfica. Para ejecutar modelos abiertos en casa, la VRAM lo es todo. Los 16 GB de una MSI GeForce RTX 5060 Ti de 16 GB, ver precio actual en Amazon son el escalón donde empiezan a caber modelos útiles cuantizados. Si tu trabajo es entrenar o servir modelos grandes, el salto real está en los 32 GB de una ASUS TUF Gaming RTX 5090 de 32 GB, ver disponibilidad en Amazon. Lo desglosamos en nuestra guía de mejores GPU para IA local.
Mini PC: la alternativa silenciosa
Los mini PC con Ryzen AI MAX+ 395 y 128 GB de memoria unificada se han convertido en la opción más interesante para quien quiere modelos grandes en local sin montar una torre: MINISFORUM MS-S1 MAX, ver precio actual en Amazon o el BOSGAME M5 con 128 GB y 2 TB, ver disponibilidad en Amazon. Tenemos la comparativa completa en mejores mini PC.
Lo que tocas todo el día
El monitor y el teclado no aceleran ningún modelo, pero son donde pasas las horas. Un panel 4K de 27 pulgadas con USB-C cabe dos terminales y un navegador sin apretar: Dell S2725QC 4K con USB-C, ver precio actual en Amazon. Y si escribes mucho, un teclado mecánico Redragon K673 Pro con distribución española, ver disponibilidad en Amazon cuesta poco y se nota desde el primer día.
Para entender qué hace por debajo un modelo como Opus 5.5, el libro de referencia en español sigue siendo Machine Learning con PyTorch y Scikit-Learn, ver disponibilidad en Amazon.
Lo que este lanzamiento dice del mercado
Hay un patrón claro en 2026 y Opus 5.5 lo confirma: las capacidades se están amontonando arriba y la competencia se ha mudado al precio. Cuando cinco modelos frontera están a dos puntos unos de otros en las mismas pruebas, lo que decide la compra es cuánto cuesta cada mil llamadas y cuánto tarda en responder.
Esto es bueno para quien construye. Hace un año, un agente que razonara en serio sobre un repositorio grande era un lujo de presupuesto corporativo. A 4 y 20 dólares por millón, con la caché a 0,20, entra en el presupuesto de un desarrollador independiente. Ese es el cambio que importa, más que los catorce puntos de Terminal-Bench.
Y para España hay un contexto añadido esta misma semana: Anthropic acaba de abrir su primera oficina en Madrid, con soporte y ventas en local. Un modelo más barato y un interlocutor con horario español no es coincidencia; es la misma estrategia.
Lecturas relacionadas
- Claude Opus 5: análisis frente a GPT-5.6 Sol y Gemini 3.6 Pro
- Cómo crear tu primer agente con la API de Claude y MCP en Python
- Tutorial de MCP servers en Claude Code
- Mejores portátiles para IA local y desarrollo
Preguntas Frecuentes
¿Cuánto cuesta Claude Opus 5.5?
Cuatro dólares por millón de tokens de entrada y veinte por millón de salida en tarifa estándar. La lectura de caché cuesta 0,20 dólares por millón y la escritura de caché, 5. El modo rápido duplica las tarifas de entrada y salida: 8 y 40 dólares.
¿Es mejor Opus 5.5 que Fable 5.1?
En las nueve pruebas que Anthropic publicó, sí, aunque en varias la diferencia es de uno o dos puntos. La propia compañía advierte de que a estos niveles los márgenes de los benchmarks predicen mal las diferencias reales. Lo que no está en discusión es el precio: Opus 5.5 cuesta la quinta parte.
¿Por qué Anthropic dice que cuesta un 40 % menos si la tarifa solo baja un 20 %?
Porque el 40 % se refiere al coste de operar cargas de trabajo típicas, no a la tarifa por token. Además de pagar menos por token, el modelo razona de forma adaptativa y necesita menos tokens de pensamiento para el mismo resultado. En cargas con poco razonamiento notarás el 20 %; en cargas agénticas puede acercarse al 40 %.
¿Se puede desactivar el modo de pensamiento en Opus 5.5?
No. El pensamiento es obligatorio en este modelo. Lo que sí se puede ajustar es el nivel de esfuerzo, que limita cuánto razona antes de responder. Si tenías código que desactivaba el pensamiento para ahorrar, hay que rehacerlo.
¿Dónde está disponible Claude Opus 5.5?
En las aplicaciones de Claude, en la API de Anthropic, en Claude Code, en Claude Cowork y en Amazon Web Services, Google Cloud y Microsoft Azure. El identificador de modelo es claude-opus-5-5.
¿Necesito una gráfica potente para usar Opus 5.5?
No. Opus 5.5 se ejecuta en los servidores de Anthropic y lo único que necesitas es conexión. La gráfica solo importa si además ejecutas modelos abiertos en local, donde manda la VRAM.
¿Merece la pena el modo rápido?
Solo cuando hay una persona esperando la respuesta en pantalla: asistentes de código, chats en directo, demos. En procesos por lotes o trabajos nocturnos pagas el doble por un tiempo que nadie mide.
Este artículo contiene enlaces afiliados a Amazon con el tag arkaiacorp-21. Si compras a través de estos enlaces, Arkaia puede recibir una comisión sin coste adicional para ti. Nuestra valoración editorial es independiente y no varía según los ingresos por afiliación.
Comentarios
Inicia sesion para dejar un comentario
Acceder