Catalogue des numéros
Percée mathématique d'OpenAI Astra, Qwen3.8-Max d'Alibaba et mise à niveau V4-Flash de DeepSeek
IANuméro quotidien

Percée mathématique d'OpenAI Astra, Qwen3.8-Max d'Alibaba et mise à niveau V4-Flash de DeepSeek

Le modèle Astra d'OpenAI résout des problèmes mathématiques de longue date, Alibaba publie le Qwen3.8-Max avec 2,4 billions de paramètres, et DeepSeek améliore son modèle V4-Flash. De plus, l'université UNAM au Mexique annule les résultats d'examens en raison de triche par IA, et Anthropic signale un incident de cybersécurité.

Podcast В· 3 min

01

Le « Astra » d'OpenAI résout des problèmes mathématiques de longue date

OpenAI a révélé qu'« Astra », une version interne de sa prochaine grande famille de modèles, a résolu avec succès 10 problèmes de longue date en mathématiques et en informatique théorique. Ces problèmes, qui incluent des défis en géométrie, théorie des groupes et complexité quantique, étaient restés non résolus depuis plus d'une décennie. Chaque preuve a été vérifiée à l'aide du prouveur de théorèmes Lean, le coût total des exécutions réussies étant estimé à environ 2 000 $ en jetons. Cette réalisation met en évidence la capacité croissante de l'IA à effectuer des raisonnements complexes en plusieurs étapes dans des domaines scientifiques. Alors que la communauté débat des implications des preuves générées par machine pour des domaines comme la médaille Fields, la capacité à résoudre des problèmes vieux de plusieurs décennies à un coût relativement faible suggère un changement significatif dans la manière dont l'IA pourrait accélérer la recherche dans la découverte de médicaments et la science des matériaux. Levent Alpoge d'Anthropic a rapporté qu'il avait pu reproduire cinq de ces preuves en utilisant le modèle Fable, démontrant que ces capacités deviennent accessibles sur différentes plateformes.

02

Alibaba publie Qwen3.8-Max

Alibaba a lancé Qwen3.8-Max, un modèle de mélange d'experts de 2,4 billions de paramètres. Le modèle est conçu pour les tâches à long horizon et le codage, Alibaba affirmant qu'il peut fonctionner de manière autonome pendant plus de 10 jours pour réaliser des projets complexes. Il aurait surpassé le Fable 5 d'Anthropic sur le classement Arena WebDev. Cette sortie est notable pour son rapport performance-prix, avec des coûts d'API fixés entre 2 et 6 dollars par million de jetons. Alibaba prévoit de publier les poids du modèle dans la communauté open source la semaine prochaine, marquant une étape importante pour les modèles de la classe Max de l'entreprise. Cette sortie intensifie la concurrence dans l'écosystème des poids ouverts, remettant en cause la domination des fournisseurs de modèles fermés.

03

DeepSeek améliore V4-Flash

DeepSeek a amélioré son modèle V4-Flash, en se concentrant sur l'amélioration des performances de codage et d'agent tout en maintenant sa structure d'API à faible coût. Le modèle, qui active environ 13 milliards de ses 284 milliards de paramètres par requête, a obtenu un score de 82,7 sur Terminal-Bench 2.1 et de 54,4 sur DeepSWE, indiquant de fortes capacités pour les tâches d'agent de codage. Avec des prix restant à 0,14 $ par million de jetons d'entrée et 0,28 $ par million de jetons de sortie, le modèle vise à rendre économiquement viables les workflows d'agents à grande échelle, tels que l'automatisation basée sur le navigateur et la classification. Cette sortie exerce une pression supplémentaire sur les laboratoires de pointe pour justifier le prix élevé de leurs modèles pour les tâches courantes.

04

L'UNAM annule les résultats d'examens en raison de triche par IA

L'Université nationale autonome du Mexique (UNAM) a annulé environ 3 000 résultats d'examens d'entrée après des preuves de triche généralisée assistée par IA. L'université, qui a mis son examen d'entrée en ligne pour la première fois cette année, a constaté une augmentation des notes parfaites qui a déclenché un examen formel des 158 000 tests passés en mai et juin. Les responsables soupçonnent une combinaison d'outils d'IA et de méthodes de triche traditionnelles. Le logiciel d'examen, fourni par Territorium Life, était destiné à empêcher un tel comportement en bloquant les onglets du navigateur et en utilisant une surveillance par IA, mais les étudiants et les critiques soutiennent que le système s'appuyait trop sur des algorithmes plutôt que sur une supervision humaine. L'incident a attiré l'attention nationale, la présidente Claudia Sheinbaum commentant publiquement le scandale.

05

Anthropic signale un incident de cybersécurité

Anthropic a révélé que ses modèles Claude ont atteint des environnements d'entreprise réels lors d'évaluations de cybersécurité en raison d'une erreur de configuration. L'erreur a laissé un environnement censé être isolé ouvert à Internet, permettant aux modèles d'interagir avec des systèmes externes. Cet incident met en évidence les risques associés aux tests d'agents autonomes dans des environnements sandbox. Alors que les laboratoires continuent de repousser les limites des capacités agentiques, le potentiel de ces modèles à interagir par inadvertance avec des systèmes réels reste un défi de sécurité critique pour l'industrie.

06

L'interdiction du Minnesota des applications « Nudify » confirmée

Un juge américain a autorisé l'entrée en vigueur de l'interdiction, une première aux États-Unis, des applications de « nudification » générées par IA dans le Minnesota. La loi, qui interdit la création et la distribution d'images sexuelles synthétiques non consensuelles, a été contestée par xAI au motif qu'elle était trop large et inconstitutionnelle. La décision du tribunal de laisser l'interdiction se poursuivre marque un développement significatif dans la réglementation au niveau des États du contenu généré par IA, établissant un précédent quant à la manière dont les juridictions peuvent tenter de freiner la prolifération de médias synthétiques nuisibles.