
El avance matemático de Astra de OpenAI, Qwen3.8-Max de Alibaba y la actualización V4-Flash de DeepSeek
El modelo Astra de OpenAI resuelve problemas matemáticos de larga data, Alibaba lanza Qwen3.8-Max con 2,4 billones de parámetros y DeepSeek actualiza su modelo V4-Flash. Además, la universidad UNAM de México anula puntuaciones de exámenes por trampas con IA, y Anthropic reporta un incidente de ciberseguridad.
Podcast В· 3 min
'Astra' de OpenAI resuelve problemas matemáticos de larga data
OpenAI ha revelado que 'Astra', una versión interna de su próxima gran familia de modelos, ha resuelto con éxito 10 problemas de larga data en matemáticas y ciencias de la computación teórica. Estos problemas, que incluyen desafíos en geometría, teoría de grupos y complejidad cuántica, habían permanecido sin resolver durante más de una década. Cada demostración fue verificada utilizando el demostrador de teoremas Lean, con un costo total estimado de aproximadamente $2,000 en tokens para las ejecuciones exitosas. Este logro destaca la creciente capacidad de la IA para realizar razonamientos complejos de múltiples pasos en dominios científicos. Mientras la comunidad debate las implicaciones de las demostraciones generadas por máquinas para campos como la Medalla Fields, la capacidad de resolver problemas de décadas de antigüedad a un costo relativamente bajo sugiere un cambio significativo en cómo la IA podría acelerar la investigación en descubrimiento de fármacos y ciencia de materiales. Levent Alpoge de Anthropic informó que pudo reproducir cinco de estas demostraciones utilizando el modelo Fable, demostrando que estas capacidades se están volviendo accesibles en diferentes plataformas.
Alibaba lanza Qwen3.8-Max
Alibaba ha lanzado Qwen3.8-Max, un modelo de mezcla de expertos con 2,4 billones de parámetros. El modelo está diseñado para tareas de largo horizonte y codificación, y Alibaba afirma que puede operar de forma autónoma durante más de 10 días para completar proyectos complejos. Según se informa, superó a Fable 5 de Anthropic en el ranking Arena WebDev. Este lanzamiento es notable por su relación rendimiento-precio, con costos de API establecidos entre $2 y $6 por millón de tokens. Alibaba planea lanzar los pesos del modelo a la comunidad de código abierto la próxima semana, lo que marca un movimiento significativo para los modelos de la clase Max de la compañía. El lanzamiento intensifica la competencia en el ecosistema de pesos abiertos, desafiando el dominio de los proveedores de modelos cerrados.
DeepSeek actualiza V4-Flash
DeepSeek ha actualizado su modelo V4-Flash, centrándose en mejorar el rendimiento de codificación y agente, mientras mantiene su estructura de API de bajo costo. El modelo, que activa aproximadamente 13 mil millones de sus 284 mil millones de parámetros por solicitud, obtuvo 82.7 en Terminal-Bench 2.1 y 54.4 en DeepSWE, lo que indica fuertes capacidades para tareas de agente de codificación. Con precios que se mantienen en $0.14 por millón de tokens de entrada y $0.28 por millón de tokens de salida, el modelo busca hacer que los flujos de trabajo de agentes a gran escala, como la automatización basada en navegador y la clasificación, sean económicamente viables. Este lanzamiento presiona aún más a los laboratorios fronterizos para que justifiquen los precios premium de sus modelos para tareas rutinarias.
UNAM anula puntuaciones de exámenes por trampas con IA
La Universidad Nacional Autónoma de México (UNAM) ha anulado aproximadamente 3,000 puntuaciones de exámenes de ingreso tras evidencia de trampas generalizadas asistidas por IA. La universidad, que trasladó su examen de ingreso en línea por primera vez este año, vio un aumento en las puntuaciones perfectas que desencadenó una revisión formal de las 158,000 pruebas realizadas en mayo y junio. Los funcionarios sospechan una combinación de herramientas de IA y métodos tradicionales de trampa. El software de examen, proporcionado por Territorium Life, estaba destinado a prevenir dicho comportamiento bloqueando pestañas del navegador y utilizando monitoreo de IA, pero los estudiantes y críticos argumentan que el sistema dependía demasiado de algoritmos en lugar de supervisión humana. El incidente ha atraído la atención nacional, y la presidenta Claudia Sheinbaum ha comentado públicamente sobre el escándalo.
Anthropic reporta incidente de ciberseguridad
Anthropic reveló que sus modelos Claude alcanzaron entornos corporativos del mundo real durante evaluaciones de ciberseguridad debido a un error de configuración. El error dejó un entorno supuestamente aislado abierto a internet, permitiendo que los modelos interactuaran con sistemas externos. Este incidente resalta los riesgos asociados con la prueba de agentes autónomos en entornos de pruebas aislados. A medida que los laboratorios continúan empujando los límites de las capacidades de los agentes, el potencial de que estos modelos interactúen inadvertidamente con sistemas del mundo real sigue siendo un desafío crítico de seguridad para la industria.
Se mantiene la prohibición en Minnesota de aplicaciones 'Nudify'
Un juez de EE. UU. ha permitido que entre en vigor la primera prohibición en la nación de Minnesota sobre aplicaciones de 'nudificación' generadas por IA. La ley, que prohíbe la creación y distribución de imágenes sexuales sintéticas no consensuadas, fue impugnada por xAI argumentando que era excesivamente amplia e inconstitucional. La decisión del tribunal de permitir que la prohibición continúe marca un desarrollo significativo en la regulación estatal del contenido de IA, estableciendo un precedente sobre cómo las jurisdicciones pueden intentar frenar la proliferación de medios sintéticos dañinos.