Claude Fable 5.1 lidera índice atualizado da Artificial Analysis
A Artificial Analysis, empresa que compara o desempenho de modelos de IA, atualizou nesta semana seu índice de inteligência para a versão 4.2. A revisão incorporou o AA-Briefcase, avaliação de trabalho intelectual com agentes e conjunto de teste privado, e o GDP.pdf, que mede raciocínio sobre 100 PDFs em dez áreas e quase 4.600 páginas. A empresa também dobrou para 40% o peso de conjuntos de teste privados e não divulgados, para reduzir a possibilidade de os laboratórios ajustarem os modelos apenas para elevar a pontuação.
No ranking geral, o Claude Fable 5.1, da Anthropic, ficou em primeiro lugar, seguido pelo GPT-6 Astra, da OpenAI. O resultado não significa que o Claude seja a melhor opção para todo uso: no teste de raciocínio sobre documentos, por exemplo, o GPT-6 Astra liderou. A atualização também retirou o GPQA Diamond, que a Artificial Analysis considera saturado.
Por que importa: O índice ganhou tarefas mais próximas de projetos profissionais e pode ajudar a montar uma lista curta de modelos. Para decidir, ainda vale testar seus próprios documentos e fluxos, além de comparar preço, velocidade, privacidade e integração. Liderar um índice agregado não elimina essas diferenças.
Fonte
artificialanalysis.aihttps://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2
Este destaque faz parte da newsletter Limiar #162: Claude Fable 5.1 lidera índice, Roland lança Melody Flip e agentes da OpenAI usam wiki pública
Receba conteúdo direto no seu email
Escolha o que funciona melhor pra você.