Cognition lança SWE-2 no Devin com menor custo em benchmark
Em 10 de setembro, a Cognition, empresa por trás do agente de programação Devin, lançou o SWE-2, seu modelo de código mais avançado. Segundo a empresa, ele alcançou 50% no FrontierCode 1.1 Main, teste de tarefas de programação, ficando a menos de um ponto do Fable 5.1 com custo 64% menor nessa avaliação. O SWE-2 foi pós-treinado a partir do Kimi K3 com aprendizado por reforço, técnica que ajusta o modelo por tentativa e erro.
O modelo já está disponível no Devin Desktop e no Devin CLI, interface de linha de comando, e começou a ser distribuído no Devin Web e no Fusion. A Cognition afirma ter treinado, em um único processo, versões com diferentes níveis de esforço de raciocínio, permitindo escolher entre velocidade, custo e desempenho sem trocar de modelo.
Por que importa: Para equipes que já usam ou avaliam o Devin, a mudança cria uma opção mais econômica dentro do próprio produto. Compare custo e taxa de conclusão em tarefas reais antes de extrapolar o resultado do benchmark para o seu fluxo.
Este destaque faz parte da newsletter Limiar #170: SWE-2 chega ao Devin, pesquisadores ligam agentes da OpenAI ao ataque no RubyGems e Anthropic promete avaliação externa
Receba conteúdo direto no seu email
Escolha o que funciona melhor pra você.