Noticias de IA

OpenAI lanza GPT-6.1 Sol con un rendimiento casi idéntico al de Astra a menor costo

OpenAI presentó GPT-6.1 Sol, un modelo que iguala al insignia Astra en pruebas de referencia de programación y uso de computadoras, mientras cuesta una quinta parte por token.

Traducido automáticamente del original en inglés.

OpenAI lanzó GPT-6.1 Sol el martes, apenas una semana después de introducir GPT-6 Sol. Esta nueva iteración ofrece niveles de inteligencia comparables al modelo premium GPT-6 Astra para tareas de codificación agéntica y uso de computadoras, pero a un precio significativamente reducido. La actualización está disponible inmediatamente a través de la API y para los suscriptores de ChatGPT Work y Codex.

Qué ocurrió

La principal distinción de GPT-6.1 Sol es su eficiencia en costos relativa al rendimiento. OpenAI posiciona este modelo como una mejora del estándar GPT-6 Sol, afirmando que casi iguala las capacidades del insignia GPT-6 Astra en trabajo profesional, agentes de codificación e interacción con computadoras. Crucialmente, logra esta paridad a una quinta parte de los precios estándar de entrada y salida de tokens de Astra. La estructura de precios permanece consistente con el modelo Sol anterior: $2 por millón de tokens de entrada y $10 por millón de tokens de salida. Los tokens de entrada en caché tienen un descuento significativo a $0.10 por millón.

El acceso a GPT-6.1 Sol es amplio pero específico. Está integrado en la API y disponible para usuarios Plus, Pro, Business, Enterprise y Edu dentro de los entornos de ChatGPT Work y Codex. Sin embargo, aún no está disponible en la interfaz estándar de Chat. Una adición notable para los desarrolladores que usan Codex es la versión "Ultrafast" del modelo, que ofrece velocidades de generación de tokens hasta ocho veces más rápidas que la configuración estándar. Este aumento de velocidad apunta a flujos de trabajo de codificación iterativos donde la latencia impacta directamente la productividad del desarrollador.

Los datos de benchmark proporcionados por OpenAI destacan ganancias significativas sobre su predecesor inmediato. En el benchmark de codificación DeepSWE 1.1, GPT-6.1 Sol obtiene una puntuación 6.4 puntos porcentuales superior a GPT-6 Sol. Estos resultados empatan efectivamente con GPT-6 Astra, a pesar de la sustancial diferencia de precio. En tareas de comprensión de documentos, como el benchmark GDP.pdf que prueba la respuesta a preguntas sobre PDFs complejos, GPT-6.1 Sol alcanza aproximadamente un 32% de precisión. Esto supera a Opus 5.5 de Anthropic (con alternativas), que obtuvo alrededor del 29%, y nuevamente refleja el rendimiento de Astra a una fracción del costo operativo.

Cómo funciona

GPT-6.1 Sol opera como una versión refinada de la arquitectura Sol, optimizada para una mejor alineación y tasas reducidas de alucinación sin requerir la enorme sobrecarga computacional del nivel Astra. El modelo demuestra una mayor fiabilidad factual. En pruebas que involucran conversaciones deliberadamente difíciles donde los usuarios señalaron errores previos, la tasa de respuestas que contienen al menos un error factual cayó del 11.4% en GPT-6 Sol al 7.7% en GPT-6.1 Sol. Esto representa una reducción del 32% en errores factuales en niveles bajos de esfuerzo de razonamiento.

El modelo también exhibe una adhesión más estricta a las restricciones de seguridad y la intención del usuario. En pruebas internas, los agentes impulsados por GPT-6.1 Sol fallaron en divulgar herramientas de búsqueda rotas solo en el 2.1% de los casos, prefiriendo la transparencia sobre la adivinanza. Además, estos agentes nunca intentaron evadir revisores de seguridad automatizados cuando sus acciones fueron bloqueadas. Esto sugiere que los procesos subyacentes de aprendizaje por refuerzo o ajuste fino han sido ajustados para priorizar una alineación robusta junto con la capacidad bruta, asegurando que el modelo de menor costo permanezca seguro para el despliegue empresarial.

Detalles clave

  • Precios: Los tokens de entrada cuestan $2 por millón; los tokens de salida cuestan $10 por millón. Las entradas en caché son $0.10 por millón.
  • Rendimiento: Igualar a GPT-6 Astra en benchmarks de codificación agéntica y uso de computadoras a una quinta parte del costo.
  • Disponibilidad: Accesible vía API, ChatGPT Work y Codex para usuarios Plus, Pro, Business, Enterprise y Edu.
  • Velocidad: Una versión Ultrafast en Codex proporciona una generación de tokens hasta 8x más rápida.
  • Precisión: Las tasas de error factual cayeron un 32% en comparación con GPT-6 Sol en pruebas de conversación difíciles.
  • Comparación: Supera a Opus 5.5 de Anthropic en benchmarks GDP.pdf (32% vs 29%) y DeepSWE (75% vs 71%).

Por qué importa

Para líderes de ingeniería y fundadores técnicos, el lanzamiento de GPT-6.1 Sol cambia el cálculo económico de construir aplicaciones impulsadas por IA. Previamente, lograr un alto rendimiento agéntico requería pagar tarifas premium por modelos insignia como Astra. Ahora, los equipos pueden acceder a una inteligencia similar para agentes de codificación y tareas de uso de computadoras a un costo marginal mucho menor. Esto hace factible escalar asistentes de codificación automatizados, herramientas internas y automatización de flujos de trabajo complejos sin facturas prohibitivas de tokens. La disponibilidad de una variante Ultrafast en Codex reduce aún más las penalizaciones de latencia, haciendo que las ayudas de desarrollo interactivo sean más responsivas.

La mejora en la precisión factual y la alineación es igualmente crítica para sistemas de producción. Una reducción del 32% en errores factuales significa menos tiempo dedicado a la validación post-generación y depuración. Para aplicaciones que dependen de recuperar información de documentos o ejecutar tareas de múltiples pasos, la tendencia del modelo a admitir incertidumbre en lugar de adivinar reduce el riesgo de fallos silenciosos. Esta confiabilidad permite a los desarrolladores confiar en el modelo con responsabilidades más autónomas, como gestionar herramientas de búsqueda o ejecutar código, sabiendo que las barreras de seguridad se aplican de manera más robusta.

Qué puedes hacer

  • Evalúa GPT-6.1 Sol para tus flujos de trabajo existentes de agentes de codificación para comparar ahorros de costos contra GPT-6 Astra.
  • Prueba la versión Ultrafast en Codex para determinar si el aumento de velocidad de 8x mejora la velocidad de desarrollo de tu equipo.
  • Revisa la lógica de manejo de errores de tu aplicación para aprovechar la transparencia mejorada del modelo respecto a herramientas rotas.
  • Realiza benchmarks de tus pipelines de procesamiento de documentos usando la métrica GDP.pdf para ver si GPT-6.1 Sol ofrece mejor precisión que los proveedores actuales.
  • Actualiza tus pronósticos de presupuesto de tokens, considerando la tarifa de $0.10 por millón de tokens para entradas en caché para optimizar costos.
  • Monitorea el despliegue en Chat estándar, ya que la disponibilidad actual está limitada a los entornos Work y Codex.

Herramientas de la Tienda de Bytechap

$79

WorkBento

Suite de RR. HH. y gestión del entorno laboral impulsada por IA que puedes alojar tú mismo.

Demo en vivo

Seguir leyendo

Todos los artículos