ITT/OPS · INSTITUTO TRIÂNGULO TECH · 25.42°S 49.27°W — CURITIBA/BR · STATUS: OPERACIONAL --:--:-- BRT
Eixo 01 — Agentes autônomos

Painel de avaliação de agentes

O ITT não compete com leaderboards genéricos de LLM — este painel foca em avaliação de agentes autônomos, o eixo 1 da pesquisa do instituto. Agregamos, nunca autoramos: todo número aqui linka de volta à fonte original.

§ 01

METR — Time Horizons

Duração de tarefa que o modelo completa com 50% de sucesso, medida contra tempo humano especialista. Escala logarítmica: o eixo Y dobra a cada divisão.

Tempo de duplicação (desde 2023):

carregando dados…

§ 02

SWE-bench Verified

% de issues reais de GitHub resolvidas de forma verificada por humanos. Cada linha é um sistema/scaffold, não um modelo puro — o modelo usado aparece na coluna própria.

§ 03

GAIA

Benchmark de assistente de propósito geral (busca, raciocínio multi-etapa, uso de ferramentas), split de teste oficial.

§ 04

Comparação cruzada (best-effort)

Nomenclatura de modelo raramente bate entre as 3 fontes (cada uma nomeia diferente). Só entram aqui modelos com match exato de nome normalizado em pelo menos 2 fontes — sem match viramos "—", nunca inventamos o número.

Como isso é atualizado

GitHub Action agendada (cron diário) busca as 3 fontes, normaliza em data/agent-panel.json e commita. O site estático só lê esse arquivo — zero chamada às fontes originais no navegador de quem visita.