Katalog numerów
Przełom matematyczny OpenAI Astra, Alibaba Qwen3.8-Max i aktualizacja DeepSeek V4-Flash
AINumer codzienny

Przełom matematyczny OpenAI Astra, Alibaba Qwen3.8-Max i aktualizacja DeepSeek V4-Flash

Model Astra od OpenAI rozwiązuje długoletnie problemy matematyczne, Alibaba wypuszcza model Qwen3.8-Max z 2,4 biliona parametrów, a DeepSeek aktualizuje swój model V4-Flash. Ponadto meksykański uniwersytet UNAM unieważnia wyniki egzaminów z powodu oszustw z użyciem AI, a Anthropic zgłasza incydent cyberbezpieczeństwa.

Podcast В· 3 min

01

„Astra” od OpenAI rozwiązuje długoletnie problemy matematyczne

OpenAI ujawniło, że „Astra”, wewnętrzna wersja ich następnej głównej rodziny modeli, pomyślnie rozwiązała 10 długoletnich problemów z matematyki i teoretycznej informatyki. Problemy te, obejmujące wyzwania z geometrii, teorii grup i złożoności kwantowej, pozostawały nierozwiązane przez ponad dekadę. Każdy dowód został zweryfikowany za pomocą asystenta dowodzenia Lean, a całkowity koszt udanych uruchomień oszacowano na około 2000 dolarów w tokenach. Osiągnięcie to podkreśla rosnącą zdolność AI do wykonywania złożonego, wieloetapowego rozumowania w dziedzinach naukowych. Podczas gdy społeczność debatuje nad implikacjami dowodów generowanych maszynowo dla dziedzin takich jak Medal Fieldsa, zdolność do rozwiązywania dziesięcioletnich problemów przy stosunkowo niskim koszcie sugeruje znaczącą zmianę w tym, jak AI może przyspieszyć badania w odkrywaniu leków i materiałoznawstwie. Levent Alpoge z Anthropic poinformował, że był w stanie odtworzyć pięć z tych dowodów za pomocą modelu Fable, co pokazuje, że te możliwości stają się dostępne na różnych platformach.

02

Alibaba wypuszcza Qwen3.8-Max

Alibaba uruchomiło Qwen3.8-Max, model mieszanki ekspertów z 2,4 biliona parametrów. Model jest przeznaczony do zadań długoterminowych i kodowania, a Alibaba twierdzi, że może działać autonomicznie przez ponad 10 dni, aby ukończyć złożone projekty. Podobno przewyższył Anthropic Fable 5 w rankingu Arena WebDev. To wydanie jest godne uwagi ze względu na stosunek wydajności do ceny, z kosztami API ustalonymi na 2 do 6 dolarów za milion tokenów. Alibaba planuje w przyszłym tygodniu udostępnić wagi modelu społeczności open source, co stanowi znaczący krok dla modeli z klasy Max firmy. Wydanie to zaostrza konkurencję w ekosystemie otwartych wag, rzucając wyzwanie dominacji dostawców zamkniętych modeli.

03

DeepSeek aktualizuje V4-Flash

DeepSeek zaktualizowało swój model V4-Flash, koncentrując się na ulepszonej wydajności kodowania i agentowej, przy jednoczesnym utrzymaniu niskokosztowej struktury API. Model, który aktywuje około 13 miliardów ze swoich 284 miliardów parametrów na żądanie, uzyskał 82,7 w Terminal-Bench 2.1 i 54,4 w DeepSWE, co wskazuje na silne możliwości w zadaniach agentowych związanych z kodowaniem. Przy cenach pozostających na poziomie 0,14 dolara za milion tokenów wejściowych i 0,28 dolara za milion tokenów wyjściowych, model ma na celu uczynienie wielkoskalowych przepływów pracy agentowych, takich jak automatyzacja oparta na przeglądarce i klasyfikacja, ekonomicznie opłacalnymi. To wydanie wywiera dalszą presję na laboratoria graniczne, aby uzasadniły wyższe ceny swoich modeli w rutynowych zadaniach.

04

UNAM unieważnia wyniki egzaminów z powodu oszustw z użyciem AI

Narodowy Uniwersytet Autonomiczny Meksyku (UNAM) unieważnił około 3000 wyników egzaminów wstępnych po dowodach powszechnego oszukiwania z pomocą AI. Uniwersytet, który po raz pierwszy w tym roku przeniósł swój egzamin wstępny do trybu online, odnotował wzrost liczby idealnych wyników, co wywołało formalną kontrolę 158 000 testów przeprowadzonych w maju i czerwcu. Urzędnicy podejrzewają kombinację narzędzi AI i tradycyjnych metod oszukiwania. Oprogramowanie egzaminacyjne, dostarczone przez Territorium Life, miało zapobiegać takim zachowaniom poprzez blokowanie kart przeglądarki i monitorowanie AI, ale studenci i krytycy argumentują, że system zbytnio polegał na algorytmach, a nie na nadzorze człowieka. Incydent przyciągnął uwagę całego kraju, a prezydent Claudia Sheinbaum publicznie skomentowała skandal.

05

Anthropic zgłasza incydent cyberbezpieczeństwa

Anthropic ujawniło, że jego modele Claude dotarły do rzeczywistych środowisk korporacyjnych podczas ocen cyberbezpieczeństwa z powodu błędu konfiguracji. Błąd pozostawił rzekomo izolowane środowisko otwarte na internet, umożliwiając modelom interakcję z zewnętrznymi systemami. Ten incydent podkreśla ryzyko związane z testowaniem autonomicznych agentów w środowiskach piaskownicy. W miarę jak laboratoria przesuwają granice możliwości agentowych, potencjał tych modeli do przypadkowej interakcji z rzeczywistymi systemami pozostaje kluczowym wyzwaniem bezpieczeństwa dla branży.

06

Podtrzymano zakaz aplikacji „nudify” w Minnesocie

Amerykański sędzia zezwolił na wejście w życie pierwszego w kraju zakazu aplikacji „nudify” generowanych przez AI w Minnesocie. Ustawa, która zakazuje tworzenia i rozpowszechniania niekonsensualnych syntetycznych obrazów o charakterze seksualnym, została zaskarżona przez xAI na tej podstawie, że była zbyt szeroka i niekonstytucyjna. Decyzja sądu o dopuszczeniu zakazu stanowi znaczący rozwój w regulacji treści AI na poziomie stanowym, ustanawiając precedens dla tego, jak jurysdykcje mogą próbować ograniczyć rozprzestrzenianie się szkodliwych syntetycznych mediów.

Przełom matematyczny OpenAI Astra, Alibaba Qwen3.8-Max i aktualizacja DeepSeek V4-Flash | Neural Format