
Il balzo matematico di OpenAI Astra, Alibaba Qwen3.8-Max e l'aggiornamento DeepSeek V4-Flash
Il modello Astra di OpenAI risolve problemi matematici di lunga data, Alibaba rilascia Qwen3.8-Max con 2,4T parametri e DeepSeek aggiorna il suo modello V4-Flash. Inoltre, l'università messicana UNAM annulla i punteggi degli esami per barare con l'IA, e Anthropic segnala un incidente di cybersecurity.
Podcast В· 3 min
'Astra' di OpenAI risolve problemi matematici di lunga data
OpenAI ha rivelato che 'Astra', una versione interna della sua prossima famiglia di modelli principali, ha risolto con successo 10 problemi di lunga data in matematica e informatica teorica. Questi problemi, che includono sfide in geometria, teoria dei gruppi e complessità quantistica, erano rimasti irrisolti per oltre un decennio. Ogni dimostrazione è stata verificata utilizzando il dimostratore di teoremi Lean, con un costo totale per le esecuzioni riuscite stimato in circa $2.000 in token. Il risultato evidenzia la crescente capacità dell'IA di eseguire ragionamenti complessi e multi-step in ambiti scientifici. Mentre la comunità discute le implicazioni delle dimostrazioni generate da macchine per campi come la Medaglia Fields, la capacità di risolvere problemi vecchi di decenni a un costo relativamente basso suggerisce un cambiamento significativo nel modo in cui l'IA potrebbe accelerare la ricerca nella scoperta di farmaci e nella scienza dei materiali. Levent Alpoge di Anthropic ha riferito di essere stato in grado di riprodurre cinque di queste dimostrazioni utilizzando il modello Fable, dimostrando che queste capacità stanno diventando accessibili su diverse piattaforme.
Alibaba rilascia Qwen3.8-Max
Alibaba ha lanciato Qwen3.8-Max, un modello mixture-of-experts da 2,4 trilioni di parametri. Il modello è progettato per attività a lungo termine e codifica, con Alibaba che afferma possa operare autonomamente per oltre 10 giorni per completare progetti complessi. Secondo quanto riferito, ha superato Anthropic Fable 5 nella classifica Arena WebDev. Questo rilascio è notevole per il suo rapporto prestazioni-prezzo, con costi API fissati tra $2 e $6 per milione di token. Alibaba prevede di rilasciare i pesi del modello alla comunità open source la prossima settimana, segnando una mossa significativa per i modelli della classe Max dell'azienda. Il rilascio intensifica la concorrenza nell'ecosistema dei pesi aperti, sfidando il dominio dei fornitori di modelli chiusi.
DeepSeek aggiorna V4-Flash
DeepSeek ha aggiornato il suo modello V4-Flash, concentrandosi sul miglioramento delle prestazioni di codifica e agentive, mantenendo al contempo la sua struttura di costo API bassa. Il modello, che attiva circa 13 miliardi dei suoi 284 miliardi di parametri per richiesta, ha ottenuto 82,7 su Terminal-Bench 2.1 e 54,4 su DeepSWE, indicando forti capacità per attività di codifica agentiva. Con prezzi che rimangono a $0,14 per milione di token in input e $0,28 per milione di token in output, il modello mira a rendere economicamente sostenibili flussi di lavoro agentivi su larga scala, come l'automazione basata su browser e la classificazione. Questo rilascio mette ulteriormente sotto pressione i laboratori di frontiera affinché giustifichino i prezzi premium dei loro modelli per attività di routine.
UNAM annulla i punteggi degli esami per barare con l'IA
L'Università Nazionale Autonoma del Messico (UNAM) ha annullato circa 3.000 punteggi degli esami di ammissione dopo prove di barare su larga scala assistito dall'IA. L'università, che ha spostato il suo esame di ammissione online per la prima volta quest'anno, ha visto un picco di punteggi perfetti che ha innescato una revisione formale dei 158.000 test sostenuti a maggio e giugno. I funzionari sospettano una combinazione di strumenti IA e metodi tradizionali di barare. Il software d'esame, fornito da Territorium Life, era inteso a prevenire tale comportamento bloccando le schede del browser e utilizzando il monitoraggio IA, ma studenti e critici sostengono che il sistema si basava troppo sugli algoritmi piuttosto che sulla supervisione umana. L'incidente ha attirato l'attenzione nazionale, con la presidente Claudia Sheinbaum che ha commentato pubblicamente lo scandalo.
Anthropic segnala un incidente di cybersecurity
Anthropic ha rivelato che i suoi modelli Claude hanno raggiunto ambienti aziendali reali durante le valutazioni di cybersecurity a causa di un errore di configurazione. L'errore ha lasciato un ambiente presumibilmente isolato aperto a Internet, consentendo ai modelli di interagire con sistemi esterni. Questo incidente evidenzia i rischi associati al test di agenti autonomi in ambienti sandbox. Mentre i laboratori continuano a spingere i confini delle capacità agentive, il potenziale per questi modelli di interagire involontariamente con sistemi reali rimane una sfida di sicurezza critica per il settore.
Confermato il divieto del Minnesota per le app 'Nudify'
Un giudice statunitense ha permesso l'entrata in vigore del primo divieto nazionale del Minnesota sulle applicazioni 'nudify' generate dall'IA. La legge, che vieta la creazione e la distribuzione di immagini sessuali sintetiche non consensuali, è stata contestata da xAI con la motivazione che fosse eccessivamente ampia e incostituzionale. La decisione del tribunale di consentire la prosecuzione del divieto segna uno sviluppo significativo nella regolamentazione a livello statale dei contenuti IA, stabilendo un precedente su come le giurisdizioni possano tentare di frenare la proliferazione di media sintetici dannosi.