
Avanço Matemático da Astra da OpenAI, Qwen3.8-Max da Alibaba e Atualização V4-Flash da DeepSeek
O modelo Astra da OpenAI resolve problemas matemáticos de longa data, a Alibaba lança o Qwen3.8-Max com 2,4 trilhões de parâmetros e a DeepSeek atualiza seu modelo V4-Flash. Além disso, a universidade UNAM do México anula notas de exames devido a trapaça com IA, e a Anthropic relata um incidente de segurança cibernética.
Podcast В· 3 min
'Astra' da OpenAI Resolve Problemas Matemáticos de Longa Data
A OpenAI revelou que 'Astra', uma versão interna de sua próxima grande família de modelos, resolveu com sucesso 10 problemas de longa data em matemática e ciência da computação teórica. Esses problemas, que incluem desafios em geometria, teoria dos grupos e complexidade quântica, permaneciam sem solução há mais de uma década. Cada prova foi verificada usando o provador de teoremas Lean, com o custo total para execuções bem-sucedidas estimado em aproximadamente US$ 2.000 em tokens. A conquista destaca a crescente capacidade da IA de realizar raciocínios complexos e de múltiplas etapas em domínios científicos. Enquanto a comunidade debate as implicações de provas geradas por máquinas para campos como a Medalha Fields, a capacidade de resolver problemas de décadas a um custo relativamente baixo sugere uma mudança significativa em como a IA pode acelerar a pesquisa em descoberta de medicamentos e ciência dos materiais. Levent Alpoge, da Anthropic, relatou que conseguiu reproduzir cinco dessas provas usando o modelo Fable, demonstrando que essas capacidades estão se tornando acessíveis em diferentes plataformas.
Alibaba Lança Qwen3.8-Max
A Alibaba lançou o Qwen3.8-Max, um modelo de mistura de especialistas com 2,4 trilhões de parâmetros. O modelo é projetado para tarefas de longo horizonte e codificação, com a Alibaba afirmando que pode operar autonomamente por mais de 10 dias para concluir projetos complexos. Ele supostamente superou o Fable 5 da Anthropic no ranking Arena WebDev. Este lançamento é notável por sua relação desempenho-preço, com custos de API definidos entre US$ 2 e US$ 6 por milhão de tokens. A Alibaba planeja liberar os pesos do modelo para a comunidade de código aberto na próxima semana, marcando um movimento significativo para os modelos da classe Max da empresa. O lançamento intensifica a competição no ecossistema de pesos abertos, desafiando o domínio dos provedores de modelos fechados.
DeepSeek Atualiza V4-Flash
A DeepSeek atualizou seu modelo V4-Flash, com foco em melhor desempenho de codificação e agente, mantendo sua estrutura de API de baixo custo. O modelo, que ativa aproximadamente 13 bilhões de seus 284 bilhões de parâmetros por requisição, obteve 82,7 no Terminal-Bench 2.1 e 54,4 no DeepSWE, indicando fortes capacidades para tarefas de agente de codificação. Com os preços permanecendo em US$ 0,14 por milhão de tokens de entrada e US$ 0,28 por milhão de tokens de saída, o modelo visa tornar economicamente viáveis fluxos de trabalho de agente em larga escala, como automação baseada em navegador e classificação. Este lançamento pressiona ainda mais os laboratórios de fronteira a justificarem os preços premium de seus modelos para tarefas rotineiras.
UNAM Cancela Notas de Exames por Trapaça com IA
A Universidade Nacional Autônoma do México (UNAM) anulou aproximadamente 3.000 notas de exames de admissão após evidências de trapaça generalizada assistida por IA. A universidade, que transferiu seu exame de admissão para o online pela primeira vez este ano, viu um pico de notas perfeitas que desencadeou uma revisão formal dos 158.000 testes realizados em maio e junho. Funcionários suspeitam de uma combinação de ferramentas de IA e métodos tradicionais de trapaça. O software de exame, fornecido pela Territorium Life, foi projetado para prevenir tal comportamento bloqueando abas do navegador e usando monitoramento de IA, mas estudantes e críticos argumentam que o sistema dependia muito de algoritmos em vez de supervisão humana. O incidente atraiu atenção nacional, com a presidente Claudia Sheinbaum comentando publicamente sobre o escândalo.
Anthropic Relata Incidente de Segurança Cibernética
A Anthropic divulgou que seus modelos Claude alcançaram ambientes corporativos reais durante avaliações de segurança cibernética devido a um erro de configuração. O erro deixou um ambiente supostamente isolado aberto para a internet, permitindo que os modelos interagissem com sistemas externos. Este incidente destaca os riscos associados ao teste de agentes autônomos em ambientes de sandbox. À medida que os laboratórios continuam a expandir os limites das capacidades de agente, o potencial para esses modelos interagirem inadvertidamente com sistemas do mundo real continua sendo um desafio crítico de segurança para a indústria.
Proibição de Minnesota de Aplicativos 'Nudify' Mantida
Um juiz dos EUA permitiu que a proibição pioneira de Minnesota de aplicativos 'nudify' gerados por IA entrasse em vigor. A lei, que proíbe a criação e distribuição de imagens sexuais sintéticas não consensuais, foi contestada pela xAI com o argumento de que era excessivamente ampla e inconstitucional. A decisão do tribunal de permitir que a proibição prossiga marca um desenvolvimento significativo na regulamentação estadual de conteúdo de IA, estabelecendo um precedente sobre como as jurisdições podem tentar conter a proliferação de mídia sintética prejudicial.