Diario Tech & IA
Anthropic lanzó el 24 de julio Claude Opus 5 con una ventana de contexto de un millón de tokens, una salida máxima de 128,000 tokens y el mismo precio de su antecesor, Opus 4.8: US$5 por millón de tokens de entrada y US$25 por millón de tokens de salida. La cifra más llamativa es el tamaño del contexto, pero la apuesta verdaderamente importante está en otro lugar: reducir el costo total de los agentes capaces de programar, utilizar computadoras y sostener proyectos extensos.
La competencia entre los grandes modelos de inteligencia artificial suele presentarse como una carrera de pruebas académicas. Cada lanzamiento llega acompañado de gráficos que muestran mejoras en razonamiento, programación, matemáticas o uso de herramientas. Sin embargo, para una empresa o un desarrollador, la pregunta decisiva no es cuál modelo ocupa temporalmente el primer lugar de una tabla, sino cuánto cuesta completar correctamente una tarea.
Ese costo no depende únicamente del precio por token. También intervienen la cantidad de intentos, el número de veces que el modelo debe volver a leer el contexto, la extensión de sus respuestas, los errores que necesitan corrección, las herramientas utilizadas y el tiempo de supervisión humana. Un modelo más costoso por millón de tokens puede resultar económicamente favorable si comprende la tarea con menos explicaciones, descubre la causa real de un problema y verifica su solución sin multiplicar las iteraciones.
Esa es precisamente la tesis comercial de Opus 5. Anthropic lo presenta como una mejora sustancial sobre Opus 4.8 para programación agéntica, análisis profesional, uso de computadoras y trabajos de larga duración, manteniendo la misma tarifa. También lo coloca cerca de Claude Fable 5, su modelo de mayor capacidad ampliamente disponible, pero a la mitad del precio. Fable 5 cuesta US$10 por millón de tokens de entrada y US$50 por millón de salida.
La diferencia entre ambos no puede reducirse al precio. Anthropic continúa recomendando Fable 5 para proyectos de varios días y elevados niveles de autonomía, mientras posiciona Opus 5 como una alternativa más equilibrada para programación y trabajo empresarial cotidiano. En declaraciones recogidas por Reuters, la empresa sostuvo que los usuarios deberían seleccionar Opus 5 por su relación entre capacidad y costo, y reservar Fable 5 para trabajos autónomos especialmente prolongados y difíciles.
Opus 5 está disponible mediante la API de Claude, Amazon Bedrock, Google Cloud y Microsoft Foundry. Su identificador en la API es claude-opus-5, lo que facilita la migración desde Opus 4.8, aunque no elimina la necesidad de revisar las integraciones. En el nuevo modelo, el razonamiento adaptativo está activado de forma predeterminada y el nivel de esfuerzo puede ajustarse entre low, medium, high, xhigh y max.
Esto tiene consecuencias directas sobre el consumo. Un nivel de esfuerzo superior puede mejorar la capacidad para resolver problemas difíciles, pero también produce más tokens de razonamiento, mayor latencia y un costo más alto por tarea. Anthropic aconseja comenzar con high y reducir o aumentar el esfuerzo después de evaluar el comportamiento del modelo en cada aplicación. El control de costos, por tanto, deja de consistir únicamente en escoger un modelo y pasa a incluir la configuración del esfuerzo adecuado para cada operación.
La compañía ofrece además un modo rápido, aproximadamente 2.5 veces más veloz que el modo normal, pero con una tarifa duplicada: US$10 por millón de tokens de entrada y US$50 por millón de salida. Esta modalidad se encuentra en vista previa y solamente está disponible mediante la API directa de Claude, no a través de Bedrock, Google Cloud o Microsoft Foundry. Puede ser útil cuando la latencia tenga valor económico, pero pierde la ventaja de precio que distingue a Opus 5 frente a Fable 5.
El millón de tokens de contexto permite incorporar grandes cantidades de código, documentación, registros y especificaciones dentro de una misma sesión. En teoría, un agente podría recibir una parte considerable de un repositorio empresarial, junto con sus modelos de datos, pruebas, documentación técnica y reglas de negocio.
Eso no significa que el modelo comprenda perfectamente cada línea. La capacidad de recibir un millón de tokens no equivale a utilizar con igual precisión toda la información contenida en ellos. Los modelos pueden perder detalles, establecer relaciones incorrectas o prestar más atención a determinadas partes del contexto. La longitud amplía el espacio disponible, pero la calidad continúa dependiendo de la organización de la información, las herramientas de búsqueda, la recuperación de archivos relevantes y la verificación posterior.
En un proyecto Django, por ejemplo, no siempre sería conveniente enviar el repositorio completo. Un agente bien diseñado podría comenzar con la estructura de directorios, identificar las aplicaciones relacionadas con la tarea y cargar solamente los modelos, vistas, formularios, servicios y pruebas pertinentes. La ventana de un millón de tokens actuaría como capacidad máxima, no como una invitación a llenar cada solicitud con archivos innecesarios.
Los 128,000 tokens de salida cumplen una función distinta. Permiten que el modelo produzca respuestas extensas, mantenga razonamientos prolongados y ejecute secuencias amplias de trabajo. En programación, la salida no se limita al código final: también incluye análisis, llamadas a herramientas, resultados de comandos, errores, pruebas y pasos de verificación. Cuanto más autónomo sea el agente, mayor puede ser el volumen de información generado durante su operación.
Sin embargo, la salida es cinco veces más costosa que la entrada. Un agente excesivamente narrativo puede consumir presupuesto sin aportar valor proporcional. La propia documentación de Anthropic advierte que Opus 5 tiende a generar entregables más extensos, narrar su progreso con mayor frecuencia, delegar más fácilmente en subagentes y verificar su trabajo incluso cuando no se le solicita. Las instrucciones creadas para modelos anteriores podrían provocar una verificación redundante y elevar el consumo.
Esto obliga a medir el costo por tarea completada, no solamente el costo de una solicitud. Supongamos que una empresa dominicana desea utilizar Opus 5 para analizar una aplicación de facturación electrónica desarrollada con Django y PostgreSQL. Si el código, la documentación y los esquemas seleccionados ocupan 400,000 tokens, la primera lectura costaría aproximadamente US$2. Una salida de 20,000 tokens agregaría otros US$0.50, para un costo inicial teórico de US$2.50.
Si el agente necesitara cinco iteraciones adicionales y volviera a procesar los mismos 400,000 tokens sin caché, solamente la entrada acumulada alcanzaría US$12. Si las seis iteraciones produjeran en conjunto 60,000 tokens de salida, se sumarían US$1.50, elevando el consumo aproximado a US$13.50.
Con caché de prompts, el resultado podría ser diferente. Anthropic cobra US$6.25 por millón de tokens para escribir un caché de cinco minutos y US$0.50 por millón para recuperarlo. Almacenar inicialmente los 400,000 tokens costaría US$2.50; leer ese contexto cinco veces desde la caché costaría aproximadamente US$1 adicional. Sumando 60,000 tokens de salida, el total teórico sería de unos US$5, sin incluir información nueva, uso de herramientas, búsquedas, tiempo de ejecución o tarifas particulares de cada proveedor de nube.
La comparación muestra por qué una ventana extensa puede ser útil y peligrosa a la vez. Permite mantener un proyecto dentro de una sesión, pero una arquitectura deficiente puede reenviar cientos de miles de tokens en cada paso. La eficiencia depende de seleccionar archivos, utilizar caché, resumir resultados, evitar respuestas innecesariamente largas y asignar cada tarea al modelo adecuado.
Tampoco todas las operaciones requieren Opus 5. Una aplicación empresarial podría utilizar un modelo más económico para clasificar solicitudes, extraer datos o generar resúmenes, y reservar Opus 5 para depurar errores complejos, revisar cambios que afectan varios módulos o planificar una migración crítica. El diseño más eficiente probablemente combinará distintos modelos según el riesgo y la dificultad.
Anthropic afirma que Opus 5 supera a otros modelos en varias evaluaciones internas y de socios. Según la empresa, en Frontier-Bench duplica el rendimiento de Opus 4.8 con menor costo por tarea; en CursorBench queda a menos de medio punto porcentual del mejor resultado de Fable 5 a la mitad del costo; y en OSWorld 2.0 supera la mejor puntuación de Fable 5 utilizando poco más de un tercio del costo. También sostiene que el modelo mejora la búsqueda de causas raíz, la revisión de código y la capacidad de completar funciones distribuidas entre varios archivos.
Son resultados importantes, pero deben interpretarse con prudencia. Las comparaciones iniciales proceden principalmente de Anthropic y de empresas que tuvieron acceso anticipado al modelo. Todavía hacen falta evaluaciones independientes que reproduzcan las tareas, midan la tasa de éxito y calculen el consumo completo, incluyendo intentos fallidos, herramientas y supervisión humana.
Una puntuación elevada en un benchmark de programación tampoco demuestra que el modelo pueda modificar con seguridad un sistema de facturación, un laboratorio clínico o una plataforma financiera. En esas aplicaciones existen reglas fiscales, datos sensibles, permisos, auditorías y consecuencias operativas que no aparecen completamente representadas en una prueba general.
La seguridad constituye otra diferencia entre Opus 5 y Fable 5. Anthropic señala que Opus 5 mostró una capacidad menor para explotar vulnerabilidades informáticas que Fable 5 y, por esa razón, opera con clasificadores de ciberseguridad proporcionalmente menos restrictivos. Puede ayudar a encontrar vulnerabilidades en código fuente, pero bloquea actividades como análisis de vulnerabilidades sobre binarios, pruebas de penetración y generación de exploits.
La empresa también afirma que Opus 5 es más resistente que sus otros modelos actuales a los intentos de inducir usos indebidos. Esto no convierte al modelo en un sistema seguro por sí mismo. Un agente con acceso a terminales, bases de datos, repositorios y servicios externos necesita permisos mínimos, credenciales temporales, ambientes aislados, registros de actividad y aprobación humana para las acciones de mayor impacto.
Para empresas de República Dominicana y América Latina, Opus 5 puede tener aplicaciones concretas. Podría ayudar a revisar proyectos Django y FastAPI, analizar consultas PostgreSQL, preparar pruebas, documentar sistemas heredados o detectar inconsistencias entre módulos. También podría utilizarse en plataformas de facturación electrónica, laboratorios clínicos, inmobiliarias, sistemas institucionales y servicios SaaS multiempresa.
El valor no debería medirse por cuántas líneas de código produce. Una evaluación seria tendría que registrar el tiempo necesario para completar la tarea, el costo de los tokens, la cantidad de errores introducidos, el porcentaje de pruebas superadas, las correcciones humanas y el efecto final sobre el tiempo de desarrollo. Sin esa medición, resulta fácil confundir una demostración impresionante con una mejora empresarial.
Claude Opus 5 no resuelve por sí solo el problema de los agentes autónomos. La ventana de un millón de tokens no garantiza comprensión total; los 128,000 tokens de salida pueden aumentar tanto la capacidad como el gasto; y los resultados publicados todavía necesitan verificación independiente. La supervisión humana continúa siendo indispensable, especialmente cuando el agente puede modificar sistemas en producción o acceder a información sensible.
Lo que sí confirma el lanzamiento es un cambio en la competencia. Los laboratorios ya no buscan solamente producir el modelo con mayor puntuación. Compiten por construir agentes capaces de sostener proyectos más largos, utilizar herramientas con mayor disciplina y alcanzar una solución correcta con menos intentos.
En esa carrera, el precio por token es apenas el comienzo. La métrica decisiva será cuánto cuesta convertir una instrucción en un resultado comprobado, seguro y verdaderamente utilizable.
Fuentes: Anthropic: presentación de Claude Opus 5, documentación técnica y migración, precios oficiales de Claude, Reuters.