Ir al contenido

El medio de los artesanos de la web miércoles, 23 de septiembre de 2026

MailStudio
IA para la web

Claude Opus 5.5: Anthropic apuesta por el coste por tarea, no por el puntaje bruto

Anthropic lanzó el 22 de septiembre de 2026 Claude Opus 5.5, con un coste un 40% menor que Opus 5 en cargas de trabajo agénticas y mejoras notables en los benchmarks de código. Los precios de la API bajan un 20% tanto…

Anthropic publicó el 22 de septiembre de 2026 Claude Opus 5.5, el primer modelo de la familia 5.5. El anuncio pone el foco menos en un puntaje récord y más en el coste por tarea: con una calidad comparable a Fable 5.1 en la mayoría de los usos, Opus 5.5 reduce la factura un 40% en cargas de trabajo agénticas típicas, con una generación más de un 30% más rápida.

Precios de la API a la baja

La tarifa de la API pasa de 5 $ / 25 $ (entrada / salida, por millón de tokens) en Opus 5 a 4 $ / 20 $ en Opus 5.5, una rebaja del 20% en ambos extremos. La lectura de caché baja de 0,50 $ a 0,20 $ por millón de tokens, una reducción del 60% que impacta directamente en las arquitecturas de agentes con contexto largo y muchas llamadas repetidas. También se ofrece un modo rápido a 8 $ / 40 $ por millón de tokens, con una mejora de velocidad de 2,5x para usos sensibles a la latencia.

PartidaOpus 5Opus 5.5Variación
Entrada (por M tokens)5 $4 $-20%
Salida (por M tokens)25 $20 $-20%
Lectura de caché (por M tokens)0,50 $0,20 $-60%
Coste típico en carga agénticareferencia-40%-40%

Mejoras concentradas en código y tareas largas

Los benchmarks publicados por Anthropic muestran un avance claro en tareas orientadas al desarrollo: Terminal-Bench 4.0 pasa del 52,3% al 66,4%, FrontierCode v1.1 del 48,0% al 54,4%, y CursorBench 4.0 del 46,6% al 57,8%. En OSWorld 2.0, que evalúa el uso completo de un ordenador, el puntaje sube del 74,0% al 81,8%.

En casos reales citados por Anthropic, un tester completó una migración de 680.000 líneas de código en menos de un día, y un port de un proxy HAProxy heredado de C a Rust tardó 9,5 horas frente a las 12 horas con Fable 5.1, una mejora del 51%. Una auditoría de código de 200.000 líneas, que antes requería más de 20 horas, ahora se completa en menos de tres.

Con una calidad comparable a Fable 5.1 en la mayoría de las tareas, Opus 5.5 reduce un 40% el coste típico de las cargas de trabajo agénticas y genera más de un 30% más rápido.

Integración con agentes y herramientas

Anthropic destaca una reducción del número de llamadas a herramientas y pasos necesarios para completar una tarea, lo que reduce directamente el coste en arquitecturas de agentes que encadenan muchas llamadas, un tema que Mail Studio ya abordó en torno a los agentes editoriales en producción. GitHub, citado en el anuncio, reporta tareas completadas en la mitad de pasos. El modelo también delega mejor en subagentes dentro de flujos multietapa, un movimiento que acerca los usos agénticos a la lógica de interoperabilidad que impulsa la especificación MCP.

import anthropic

client = anthropic.Anthropic()
response = client.messages.create(
    model="claude-opus-5-5",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Audita este modulo y enumera las regresiones probables."}],
)
print(response.content[0].text)

El modo de razonamiento («thinking») ya no se puede desactivar en Opus 5.5, a diferencia de versiones anteriores. Las integraciones que dependían de un modo sin razonamiento para reducir la latencia tendrán que recalibrar sus tiempos de espera y la gestión del flujo de salida antes de pasar a producción.

Disponibilidad

El modelo está disponible a través de la API de Claude, así como en Amazon Web Services, Google Cloud y Microsoft Azure, bajo el identificador claude-opus-5-5. Anthropic indica que el modelo fue evaluado por organismos externos, entre ellos METR y Frontier Design, antes de su lanzamiento. Mail Studio hace seguimiento de los usos profesionales de la IA para el desarrollo en su guía de IA para desarrolladores web.

Lo que hay que recordar

Opus 5.5 no busca batir a toda costa los puntajes brutos de las generaciones anteriores, sino reducir el coste y el tiempo necesarios para obtener un resultado equivalente, especialmente en tareas de código y flujos agénticos largos. La rebaja de precios de la API acompaña ese posicionamiento y hace el uso en producción más sostenible para equipos que encadenan muchas llamadas.

Lo que más me llama la atención de este anuncio es el cambio de discurso: durante dos años los laboratorios comunicaban sobre puntajes de benchmark, y aquí Anthropic comunica sobre el coste por tarea realmente completada. Es el indicador correcto para quien despliega agentes en producción, y es más difícil de sobrevender que una cifra de leaderboard. Queda por comprobar en mis propias cargas de trabajo si la relación calidad-coste se mantiene con el tiempo, no solo en los casos de demostración — Simon Janvier.

Para saber más: el anuncio completo está disponible en anthropic.com/news.

Compartir LinkedIn Bluesky Hacker News E-mail

Leer también