
OpenAI's Astra Wiskundige Doorbraak, Alibaba's Qwen3.8-Max, en DeepSeek's V4-Flash Upgrade
OpenAI's Astra-model lost langdurige wiskundeproblemen op, Alibaba brengt de 2,4T-parameter Qwen3.8-Max uit, en DeepSeek upgradet zijn V4-Flash-model. Daarnaast annuleert de Mexicaanse UNAM-universiteit examenscores vanwege AI-fraude, en rapporteert Anthropic een cyberbeveiligingsincident.
Podcast В· 3 min
OpenAI's 'Astra' Lost Langdurige Wiskundeproblemen Op
OpenAI heeft onthuld dat 'Astra', een interne versie van zijn volgende grote modelfamilie, met succes 10 langdurige problemen in de wiskunde en theoretische informatica heeft opgelost. Deze problemen, waaronder uitdagingen in meetkunde, groepentheorie en quantumcomplexiteit, bleven al meer dan een decennium onopgelost. Elk bewijs werd geverifieerd met behulp van de Lean-stellingbewijzer, waarbij de totale kosten voor succesvolle runs worden geschat op ongeveer $2.000 aan tokens. De prestatie benadrukt het groeiende vermogen van AI om complexe, meerstapsredeneringen in wetenschappelijke domeinen uit te voeren. Terwijl de gemeenschap debatteert over de implicaties van machine-gegenereerde bewijzen voor velden zoals de Fields-medaille, suggereert het vermogen om tientallen jaren oude problemen tegen relatief lage kosten op te lossen een significante verschuiving in hoe AI onderzoek in medicijnontdekking en materiaalwetenschap zou kunnen versnellen. Anthropic's Levent Alpoge meldde dat hij in staat was om vijf van deze bewijzen te reproduceren met behulp van het Fable-model, wat aantoont dat deze mogelijkheden toegankelijk worden op verschillende platforms.
Alibaba Brengt Qwen3.8-Max Uit
Alibaba heeft Qwen3.8-Max gelanceerd, een 2,4 biljoen parameter mixture-of-experts-model. Het model is ontworpen voor langdurige taken en codering, waarbij Alibaba beweert dat het autonoom meer dan 10 dagen kan werken om complexe projecten te voltooien. Het zou naar verluidt beter hebben gepresteerd dan Anthropic's Fable 5 op de Arena WebDev-ranglijst. Deze release is opmerkelijk vanwege de prestatie-prijsverhouding, met API-kosten van $2 tot $6 per miljoen tokens. Alibaba is van plan om de modelgewichten volgende week vrij te geven aan de open-sourcegemeenschap, wat een belangrijke stap markeert voor de Max-klasse modellen van het bedrijf. De release intensiveert de concurrentie in het open-gewichten ecosysteem en daagt de dominantie van gesloten modelleveranciers uit.
DeepSeek Upgradet V4-Flash
DeepSeek heeft zijn V4-Flash-model geüpgraded, met de focus op verbeterde codeer- en agentprestaties, terwijl de goedkope API-structuur behouden blijft. Het model, dat ongeveer 13 miljard van zijn 284 miljard parameters per verzoek activeert, scoorde 82,7 op Terminal-Bench 2.1 en 54,4 op DeepSWE, wat duidt op sterke mogelijkheden voor codeer-agent taken. Met prijzen die blijven op $0,14 per miljoen invoertokens en $0,28 per miljoen uitvoertokens, streeft het model ernaar om grootschalige agentworkflows, zoals browsergebaseerde automatisering en classificatie, economisch haalbaar te maken. Deze release zet verdere druk op grensverleggende laboratoria om de premiumprijzen van hun modellen voor routinetaken te rechtvaardigen.
UNAM Annuleert Examenscores Vanwege AI-Fraude
De Nationale Autonome Universiteit van Mexico (UNAM) heeft ongeveer 3.000 toelatingsexamenscores geannuleerd na bewijs van wijdverbreide AI-ondersteunde fraude. De universiteit, die dit jaar voor het eerst haar toelatingsexamen online afnam, zag een piek in perfecte scores die leidde tot een formele herziening van de 158.000 tests die in mei en juni werden afgenomen. Functionarissen vermoeden een combinatie van AI-tools en traditionele fraudemethoden. De examensoftware, geleverd door Territorium Life, was bedoeld om dergelijk gedrag te voorkomen door browsertabbladen te blokkeren en AI-monitoring te gebruiken, maar studenten en critici beweren dat het systeem te veel vertrouwde op algoritmen in plaats van menselijk toezicht. Het incident heeft nationale aandacht getrokken, waarbij president Claudia Sheinbaum publiekelijk commentaar gaf op het schandaal.
Anthropic Rapporteert Cyberbeveiligingsincident
Anthropic onthulde dat zijn Claude-modellen echte bedrijfsomgevingen bereikten tijdens cyberbeveiligingsevaluaties als gevolg van een configuratiefout. De fout liet een verondersteld geïsoleerde omgeving open voor het internet, waardoor de modellen konden interageren met externe systemen. Dit incident benadrukt de risico's die gepaard gaan met het testen van autonome agenten in sandbox-omgevingen. Terwijl laboratoria de grenzen van agentische mogelijkheden blijven verleggen, blijft het potentieel voor deze modellen om onbedoeld te interageren met echte systemen een kritieke beveiligingsuitdaging voor de industrie.
Minnesota Verbod op 'Nudify'-Apps Gehandhaafd
Een Amerikaanse rechter heeft het eerste verbod in de natie van Minnesota op AI-gegenereerde 'nudify'-toepassingen laten ingaan. De wet, die het creëren en verspreiden van niet-consensuele synthetische seksuele beelden verbiedt, werd aangevochten door xAI op grond van het feit dat deze te breed en ongrondwettelijk was. De beslissing van de rechtbank om het verbod door te laten gaan, markeert een belangrijke ontwikkeling in de regulering van AI-inhoud op staatsniveau, en schept een precedent voor hoe rechtsgebieden kunnen proberen de verspreiding van schadelijke synthetische media in te dammen.