O que é o ARC-AGI
O ARC-AGI (Abstraction and Reasoning Corpus for Artificial General Intelligence) e um benchmark criado por François Chollet, o engenheiro do Google que também criou o Keras. Ele foi publicado em 2019 com um objetivo claro: medir se uma IA consegue realmente generalizar e raciocinar, em vez de apenas memorizar padrões de treinamento.
A ideia surgiu de uma frustração real de Chollet com os benchmarks existentes. Testes como o MMLU ou o HumanEval podem ser "passados" por um modelo que simplesmente memorizou respostas do dataset de treino. O ARC-AGI foi projetado para ser resistente a isso, exigindo raciocínio por analogia em puzzles visuais que o modelo nunca viu antes.
Em 2024, a ARC Prize Foundation lançou um prémio de 1 milhão de dólares para qualquer sistema que atingisse 85% de acerto no benchmark. Isso colocou o ARC-AGI no centro das discussões sobre AGI nos maiores labs do mundo, incluindo OpenAI, Anthropic, Google DeepMind e dezenas de pesquisadores independentes.
Como funciona
Cada tarefa do ARC-AGI apresenta uma grade colorida com pixels e um padrão lógico. O modelo recebe alguns pares de exemplo (entrada/saída) e precisa descobrir a regra por trás deles para então aplicar essa regra a uma nova entrada e produzir a saída correta. Parece simples, e para humanos e: a taxa de acerto humana e de cerca de 85%.
O segredo e que cada puzzle usa um conceito diferente. Pode ser simetria, contagem, preenchimento de padrões, translação, rotação ou combinações dessas ideias. Os conceitos são elementares para humanos, mas exigem que o sistema raciocine do zero, sem poder depender de padrões vistos no treino.
Você pode testar puzzles do ARC-AGI no próprio site do projeto em arcprize.org e ter uma sensação exata do que as IAs precisam resolver.
O benchmark e dividido em dois conjuntos: um público (para desenvolvimento) e um privado (para avaliação oficial). Os resultados oficiais no leaderboard usam o conjunto privado, o que evita que times treinem diretamente nos puzzles de avaliação.
Principais recursos
O ARC-AGI tem características que o tornam único no ecossistema de benchmarks de IA:
- Resistência ao overfitting: os puzzles são novos para o modelo na hora do teste, o que elimina a vantagem de memorizar datasets.
- Leaderboard público e transparente: qualquer pessoa pode submeter resultados em arcprize.org e ver onde seu sistema se posiciona.
- Métrica simples: percentual de puzzles resolvidos corretamente, sem ambiguidade sobre o que contar.
- ARC-AGI-2: versão mais difícil lançada em 2025, com puzzles que desafiam até os melhores sistemas atuais.
- Comparação com humanos: o benchmark foi calibrado para que humanos comuns (sem treinamento especial) resolvam cerca de 85% dos puzzles.
O leaderboard em arcprize.org mostra em tempo real quais sistemas lideram, com detalhes sobre métodos usados e reproducibilidade.
Como começar: acessando e testando
Para explorar o ARC-AGI, o ponto de entrada e o site oficial:
# Clonar o repositório oficial do ARC-AGI
git clone https://GitHub.com/fchollet/ARC-AGI.git
# Estrutura de dados
# data/training/ - 400 tarefas para desenvolvimento
# data/evaluation/ - 400 tarefas para avaliação local
# data/test/ - conjunto privado (respostas não públicas)Cada tarefa e um arquivo JSON simples. Você pode carregar qualquer tarefa e visualizar os pares de exemplo antes de tentar resolver. Para submissões oficiais, crie uma conta em arcprize.org e siga o processo de submissão descrito na documentação.
O conjunto de teste oficial não tem as respostas disponíveis publicamente. Qualquer placar acima de 0% no leaderboard oficial foi obtido por submissão real ao sistema de avaliação do ARC Prize.
Para quem quer treinar um sistema, o repositório inclui scripts de visualização e exemplos de como carregar as tarefas em Python. O formato JSON e simples o suficiente para integrar com qualquer framework de ML.
Exemplo prático
Imagine um puzzle simples: nos exemplos, uma linha de quadrados azuis sempre tem um quadrado vermelho ao final. A entrada de teste e uma linha de quadrados azuis sem o vermelho. O sistema precisa inferir a regra e completar com um quadrado vermelho na posição correta.
# Exemplo de formato de uma tarefa ARC-AGI (JSON simplificado)
{
"train": [
{
"input": [[0,0,2,2,2]],
"output": [[0,0,2,2,2,1]]
},
{
"input": [[0,2,2]],
"output": [[0,2,2,1]]
}
],
"test": [
{
"input": [[2,2,2,2]]
// output esperado: [[2,2,2,2,1]]
}
]
}Os puzzles reais são grades 2D com cores representadas por números de 0 a 9. A regra pode ser qualquer coisa: simetria, reflexão, contagem de objetos, preenchimento de lacunas, translação de padrões. O desafio e descobrir a regra a partir de apenas 3 a 5 exemplos.
Comparação com alternativas
O ecossistema de benchmarks de IA e vasto, mas o ARC-AGI tem um nicho bem definido:
- MMLU: testa conhecimento de mundo (trivia, ciências, direito). Pode ser passado com memorizar textos. Não mede raciocínio novo.
- HumanEval / SWE-Bench: testa programação. Ótimo para avaliar coders de IA, mas não mede inteligência geral.
- GSM8K: problemas de matemática escolar. Útil, mas resolvível com chain-of-thought em LLMs grandes.
- ARC-AGI: único benchmark projetado especificamente para resistir a memorizar. Mede generalização real.
O ARC-AGI e mais lento de rodar (cada puzzle exige inferência real) e mais difícil de otimizar, mas e o mais honesto sobre o que o sistema realmente sabe fazer.
Pontos positivos e limitações
O ARC-AGI tem pontos fortes claros. Ele é o benchmark mais resistente a overfitting que existe hoje. O leaderboard público cria uma competição saudável e transparente. O formato de dado e simples e bem documentado. E a correlação com capacidade de raciocínio geral e mais forte do que em outros benchmarks.
Mas também tem limitações reais. Os puzzles são visuais e espaciais, o que significa que o benchmark avalia principalmente raciocínio visuo-espacial, não linguagem, matemática avançada ou outros domínios. Além disso, mesmo um sistema que resolva 90% dos puzzles pode estar usando técnicas muito distantes do que chamamos de inteligência geral humana.
Alta pontuação no ARC-AGI não significa AGI. Significa que o sistema e bom em raciocínio visuo-espacial abstrato. E um sinal importante, mas não o único critério para AGI.
O ARC-AGI-2, lançado em 2025, aumentou significativamente a dificuldade. Até meados de 2025, os melhores sistemas públicos ainda estavam bem abaixo dos 85% que humanos comuns atingem, mostrando que ha muito caminho pela frente.
Casos de uso reais
O ARC-AGI tem aplicações concretas para diferentes perfis:
- Pesquisadores de IA: usam o benchmark para avaliar novas arquiteturas de raciocínio, como sistemas neuro-simbólicos ou abordagens de program synthesis.
- Labs de IA: times como OpenAI e DeepMind usam o ARC-AGI como sinal de progresso interno, mesmo sem publicar todos os resultados no leaderboard público.
- Desenvolvedores independentes: muitos dos melhores resultados no leaderboard vieram de competidores individuais, não de grandes empresas.
- Educadores e divulgadores: os puzzles do ARC-AGI são excelentes para explicar de forma intuitiva o que significa realmente raciocinar versus memorizar.
Dicas e boas práticas
Antes de tentar treinar um modelo no ARC-AGI, resolva você mesmo pelo menos 20 puzzles do conjunto de treino. Isso da uma intuição real sobre o tipo de raciocínio exigido.
As abordagens que lideram o leaderboard frequentemente combinam LLMs com busca discreta ou program synthesis. Puro fine-tuning de LLM raramente passa dos 40%.
Não confunda o conjunto de avaliação local (cujas respostas são públicas) com o conjunto de teste oficial. Treinar no conjunto de avaliação da uma vantagem artificial que não aparece no leaderboard oficial.
Vale a pena acompanhar?
Se você se importa com o progresso real da IA, sim. O ARC-AGI e o melhor sinal público disponível sobre se os modelos estão ficando genuinamente mais inteligentes ou apenas maiores. Quando um sistema humano ultrapassa os 85% no ARC-AGI-2, isso vai ser uma das noticias mais importantes da historia da tecnologia.
Para desenvolvedores, acompanhar o leaderboard custa zero e oferece uma perspectiva única sobre o estado da arte que vai muito além do que o marketing dos labs pública. Vale favoritar arcprize.org e checar periodicamente quem subiu no placar e com qual técnica.
Comentários
Deixar um comentárioVocê precisa ter uma conta no DevLevelUp para comentar.