limiar
Destaques
Destaque do Dia

Claude Fable 5.1 lidera índice atualizado da Artificial Analysis

5 de setembro de 2026
Claude

A Artificial Analysis, empresa que compara o desempenho de modelos de IA, atualizou nesta semana seu índice de inteligência para a versão 4.2. A revisão incorporou o AA-Briefcase, avaliação de trabalho intelectual com agentes e conjunto de teste privado, e o GDP.pdf, que mede raciocínio sobre 100 PDFs em dez áreas e quase 4.600 páginas. A empresa também dobrou para 40% o peso de conjuntos de teste privados e não divulgados, para reduzir a possibilidade de os laboratórios ajustarem os modelos apenas para elevar a pontuação.

No ranking geral, o Claude Fable 5.1, da Anthropic, ficou em primeiro lugar, seguido pelo GPT-6 Astra, da OpenAI. O resultado não significa que o Claude seja a melhor opção para todo uso: no teste de raciocínio sobre documentos, por exemplo, o GPT-6 Astra liderou. A atualização também retirou o GPQA Diamond, que a Artificial Analysis considera saturado.

Por que importa: O índice ganhou tarefas mais próximas de projetos profissionais e pode ajudar a montar uma lista curta de modelos. Para decidir, ainda vale testar seus próprios documentos e fluxos, além de comparar preço, velocidade, privacidade e integração. Liderar um índice agregado não elimina essas diferenças.

Fonte

artificialanalysis.ai

https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2

Receba conteúdo direto no seu email

Escolha o que funciona melhor pra você.