Painel de avaliação de agentes
O ITT não compete com leaderboards genéricos de LLM — este painel foca em avaliação de agentes autônomos, o eixo 1 da pesquisa do instituto. Agregamos, nunca autoramos: todo número aqui linka de volta à fonte original.
METR — Time Horizons
Duração de tarefa que o modelo completa com 50% de sucesso, medida contra tempo humano especialista. Escala logarítmica: o eixo Y dobra a cada divisão.
Tempo de duplicação (desde 2023): —
carregando dados…
SWE-bench Verified
% de issues reais de GitHub resolvidas de forma verificada por humanos. Cada linha é um sistema/scaffold, não um modelo puro — o modelo usado aparece na coluna própria.
GAIA
Benchmark de assistente de propósito geral (busca, raciocínio multi-etapa, uso de ferramentas), split de teste oficial.
Comparação cruzada (best-effort)
Nomenclatura de modelo raramente bate entre as 3 fontes (cada uma nomeia diferente). Só entram aqui modelos com match exato de nome normalizado em pelo menos 2 fontes — sem match viramos "—", nunca inventamos o número.
Como isso é atualizado
GitHub Action agendada (cron diário) busca as 3 fontes, normaliza em data/agent-panel.json e commita. O site estático só lê esse arquivo — zero chamada às fontes originais no navegador de quem visita.