TSJ Staff
OpenAI canceló el lanzamiento de GPT-6.1 Astra, previsto para octubre, porque el modelo no superó el umbral interno de seguridad de la compañía. En su DevDay presentó Dots, agentes que trabajan de forma continua, cada uno con su propia computadora en la nube, y GPT-6.1 Sol, un modelo de rendimiento cercano al de GPT-6 Astra a una quinta parte de su precio.
OpenAI canceló el lanzamiento público de GPT-6.1 Astra, previsto para octubre en ChatGPT y Codex, después de que el modelo no superara el umbral interno de seguridad de la compañía. La empresa confirmó la decisión el lunes, en la víspera de DevDay, su conferencia anual para desarrolladores. Allí presentó este martes Dots, agentes que trabajan de forma continua con GPT-6 Astra, y GPT-6.1 Sol, un modelo de rendimiento cercano al de GPT-6 Astra a una quinta parte de su precio.
Según OpenAI, GPT-6.1 Astra completaba tareas complejas sin asistencia mejor que GPT-6 Astra, lanzado el 3 de septiembre, pero retrocedió en dos áreas críticas. En las pruebas mostró niveles de engaño más altos que su predecesor, ya que no siempre informaba con precisión qué había hecho. Además, en algunos casos avanzó con una tarea sin pedir permiso o intentó usar herramientas externas aun cuando eso podía ser riesgoso. En lugar de lanzarlo, la empresa se enfocará en la seguridad de sus próximos modelos.
Dots son agentes personales que persiguen objetivos definidos por el usuario en segundo plano y con supervisión mínima. Cada agente trabaja desde su propia computadora en la nube, con un navegador propio que el usuario puede abrir para revisar lo que hizo, y accede a más de 4.000 aplicaciones mediante complementos. Se les puede escribir o llamar desde ChatGPT y también desde Slack y Teams. El despliegue empezó para los suscriptores de ChatGPT Pro, salvo en el Espacio Económico Europeo, Suiza y el Reino Unido, y para los de Business Premium, con un agente incluido sin costo adicional. Los planes Enterprise, Edu y Healthcare acceden a una beta.
GPT-6.1 Sol cuesta US$2 por millón de tokens de entrada y US$10 por millón de salida en la API, y US$0,10 por millón de tokens de entrada en caché. Según la compañía, iguala a Astra en DeepSWE v1.1, una prueba de ingeniería de software sobre código real, y queda a 2,1 puntos de ese modelo en OSWorld 2.0, que evalúa el manejo de computadoras, con un costo por tarea unas siete veces menor. Ya está disponible para usuarios Plus, Pro, Business, Enterprise y Edu en ChatGPT Work y Codex.
Aunque GPT-6.1 Astra mejoró en aspectos como la pereza del modelo, no alcanzó el estándar en cuanto a mantenerse dentro del alcance y de lo autorizado, ni en la forma de comunicarle al usuario el tipo de trabajo que hizo.