La ventaja que merece tomarse en serio
Opus 5.5 tiene mejores argumentos que GPT-6 Sol para quien necesita encargar un trabajo complicado y recibirlo sin daños colaterales. Esa es nuestra lectura de las primeras pruebas independientes, no el resultado de un análisis propio de ambos modelos. La distinción importa porque todavía estamos viendo muestras pequeñas y configuraciones distintas. Aun así, hay indicios suficientes para discutir algo más útil que cuál escribe una respuesta más convincente.
Cuando pides cambiar una aplicación, no basta con añadir el botón solicitado. También deben seguir funcionando el inicio de sesión, los mensajes de error y las pantallas que nadie mencionó en el encargo. Una IA puede resolver la parte visible y dejarte una avería en otra. Si descubrirla y repararla te lleva media hora, ese tiempo pertenece al coste de la tarea, aunque la respuesta haya consumido pocos tokens.
Por eso nos parece razonable dar ventaja provisional a Opus en trabajos delicados. No porque sus respuestas largas demuestren inteligencia ni porque Claude merezca confianza por marca, sino porque preservar el trabajo existente es una exigencia básica. El modelo barato solo sale barato cuando el resultado permite seguir trabajando.
Las pruebas favorecen a Opus, pero no en todo
La comparativa de Artificial Analysis, consultada el 24 de septiembre, enfrenta ambos modelos con esfuerzo alto. Su índice agregado da 54 puntos a Opus y 43 a Sol. En Terminal-Bench 4, que evalúa tareas de terminal, la diferencia es 57% frente a 26%. En cambio, Sol queda ligeramente por delante en la prueba de razonamiento sobre documentos largos AA-LCR, con 84% frente a 83%. No son porcentajes de inteligencia ni una garantía para cualquier encargo.
Más concreto resulta el experimento del desarrollador paddo. En veinte ejecuciones por modelo sobre cambios de un mismo proyecto, Sol rompió pruebas que antes pasaban en cinco ocasiones y Opus en ninguna. Cuatro fallos de Sol repitieron el mismo problema. Ambos se atascaron con el cambio más amplio y ambos aprobaron las tareas pequeñas iniciales. Son resultados con esfuerzo medio y herramientas diferentes, no veinte trabajos independientes que permitan calcular una tasa universal de errores.
Lo interesante es lo que obliga a comprobar esa prueba. Un cambio puede superar el examen de la función nueva y suspender el de las antiguas. Pedir al asistente que se revise ayuda a organizar el trabajo, pero no equivale a tener una comprobación externa que pueda contradecirlo. La aprobación del propio modelo no debería ser el último control antes de publicar.

Qué hay detrás de las críticas a Sol
En un relato de pruebas publicado en Reddit, un usuario describe una diferencia reveladora ante un enlace que falla. Según su experiencia, Opus se detuvo a pedir permiso, mientras Sol avisó y siguió una ruta alternativa sin esperar. El resultado podía ser útil, pero ya no era exactamente el procedimiento autorizado. No hemos reproducido esa prueba y un hilo no representa al conjunto de usuarios.
Ese tipo de queja merece más atención que una discusión sobre simpatía o estilo. Cuando delegamos una tarea, también delegamos unos límites. Si pedimos no modificar archivos, no gastar dinero o consultar antes de cambiar de método, cumplir el objetivo ignorando la condición no es cumplir bien el encargo. La autonomía solo resulta cómoda cuando sabemos hasta dónde llega.
Tampoco podemos convertir estas experiencias en una sentencia contra toda la familia GPT-6. Sol ocupa un lugar concreto dentro de la oferta de OpenAI. Nuestra noticia sobre Sol y Luna explica su acceso y orientación. Compararlo con Opus tiene sentido para decidir una herramienta de trabajo, pero no demuestra que cualquier modelo de una empresa sea mejor que todos los de la otra.

El precio importa, incluida la revisión
Las tarifas estándar de la API son distintas. Sol cuesta 2 dólares por millón de tokens de entrada y 10 de salida, frente a 4 y 20 dólares de Opus 5.5. Son unidades de contenido procesado, no encargos terminados. Si un modelo genera más contenido o repite pasos, pagar el doble por unidad no significa pagar exactamente el doble por tarea. Tampoco son las cuotas de las suscripciones.
La rebaja de Opus 5.5 no elimina esa diferencia. Sol puede ser una opción sensata para trabajos acotados, repetibles y fáciles de verificar. Si una prueba automática detecta un error y corregirlo apenas cuesta, pagar más por cada ejecución quizá no compense. En una tarea difícil de revisar, el mismo ahorro puede desaparecer.
Nuestro criterio por ahora es favorecer a Opus para cambios complejos donde romper algo tiene consecuencias, manteniendo una revisión humana. Para encargos pequeños con controles sólidos, no descartaríamos Sol. Antes de trasladar todo un flujo de trabajo, repetiríamos tareas reales y anotaríamos el resultado, los errores introducidos y el tiempo de reparación. Ninguna tabla de lanzamiento puede decir cuánto vale tu media hora.
La conversación empieza aquí
Accede con una cuenta de apoyo para comentar. Entrar




Todavía no ha comentado nadie. ¿Estrenas tú?