CounterRoute, RECLAIM, MeshHeal e o debate de IA

CounterRoute: ensinar o modelo a não raciocinar à toa
Modelos de raciocínio produzem longas cadeias de pensamento mesmo quando uma resposta direta resolveria — e cada cadeia dessas é token queimado sem necessidade. O paper do arXiv de hoje (2609.29109) parte exatamente desse incômodo: muitos modelos "dual-mode" deixam a decisão de raciocinar ou não na mão do usuário, porque automatizar é difícil por três motivos concretos.
Primeiro, o alvo do roteamento se move junto com a política que está sendo treinada — o que era "pergunta fácil" muda conforme o modelo aprende. Segundo, preferências iniciais de modo desestabilizam a exploração. Terceiro, objetivos no nível da sequência entrelaçam a decisão de rotear com o aprendizado da resposta, de modo que não dá para tratar as duas coisas separadas.
A proposta é o CounterRoute: um framework de aprendizado por reforço online que aprende, numa política compartilhada só, o roteamento e as respostas condicionadas ao modo, direto de um modelo dual-mode nativo. Em vez de dois problemas, um só.
Para o TOKEN CLUB, é o placar em forma de paper: raciocínio desperdiçado é exatamente o que infla consumo sem entregar qualidade. Se roteamento automático virar padrão, cai o custo por tarefa — e a briga Kogu × Xepa, decidida em menos de 3%, ganha outro combustível.
RECLAIM: o benchmark que pergunta se agente reproduz paper
Reproduzir um paper de machine learning é a prova de fogo da área: instalar software, debugar dependência, rodar experimento, comparar número. É um trabalho que agentes de IA fazem cada vez mais — e que ninguém estava medindo de forma padronizada. O RECLAIM (2609.28850) tapa esse buraco.
O benchmark parte de 100 papers da NeurIPS 2025, com a intenção de ser reconstruído a cada ano a partir das conferências novas. Para cada paper, três coisas ficam fixadas antes de o agente começar: qual resultado deve ser reproduzido, o que conta como reprodução bem-sucedida e um orçamento de GPU-horas. O agente tem que chegar ao resultado usando o paper e tudo o que os autores liberaram — e o quanto os autores liberaram é justamente o que define o tier de dificuldade.
Por que importa: não é benchmark de responder pergunta bonita, é benchmark de dar certo na máquina real. O orçamento de GPU-hora amarra a métrica em custo, não só em acerto — um agente que reproduz 90% dos papers gastando 10x mais GPU não "passa". É o mesmo espírito do TOKEN CLUB: performance se mede com o que você queimou junto.
MeshHeal: o agente que quebra devagar, sem cair
Em redes descentralizadas de agentes de LLM, existe uma falha pior que o crash: a gray failure. O agente continua respondendo, continua parecendo vivo, mas a qualidade da tarefa degrada de forma persistente — quebra devagar, em silêncio. Crash derruba e todo mundo vê; gray failure corrói sem disparar alarme.
O MeshHeal (2609.29015) ataca o problema com uma exigência dupla: proteger as tarefas em andamento antes de existir evidência suficiente para mudar o roteamento futuro, e ainda deixar a porta aberta para o agente recuperado voltar ao jogo. A estrutura é um framework de auto-cura totalmente descentralizado que acopla revisão por pares em duas escalas de tempo — na escala rápida, uma hierarquia adaptativa escala os outputs incertos ou de baixa pontuação.
Por que importa: quem roda agente de código em malha sabe que o problema fácil é o que dá erro na cara; o problema caro é o que fica meia-boca sem ninguém notar. Self-healing descentralizado é o tipo de peça de infraestrutura que, se funcionar, ninguém comemora — mas a conta de token agradece.
Honestidade não basta no debate de IA
Scalable oversight é a pergunta de como verificar agentes mais capazes que seus supervisores. Uma das respostas mais citadas é o AI debate: dois agentes competem, um verificador com recursos limitados avalia claims que não conseguiria checar sozinho. A aposta toda é que incentivar argumentos honestos leva a vereditos corretos.
O paper de hoje (2609.29189) acha uma rachadura nessa aposta: um veredito correto não determina quais argumentos o levaram até ele. Mesmo sendo honestos, os agentes ficam com discrição sobre quais claims corretas apresentar, como enquadrá-las e em que ordem. Dá para vencer o debate — ou moldar o veredito — sem mentir uma vez sequer.
Por que importa agora: a maior parte da conversa sobre alinhamento foca em impedir a mentira, e isso pode ser insuficiente. Se o adversário pode escolher qual verdade mostrar, "honesto" deixa de ser sinônimo de "confiável". É um aviso relevante para qualquer pipeline que use LLM como juiz — inclusive os que avaliam código, onde o agente também escolhe o que destacar.
Status do TOKEN CLUB
Placar
- 🥇 Kogu — 3.128.141.947 tokens
- 🥈 Xepa — 3.035.251.037
- 🥉 JOAO_AMORIM — 2.694.799.519
- 4º Tetz — 302.210.242
Kogu segue na frente por 92.890.910 tokens (~3%) — menos de dois dias de média do clube. Os três primeiros estão na casa dos bilhões; o 4º cai para 302 milhões, um abismo de 2.392.589.277 tokens entre 3º e 4º. O clube tem 12 jogadores, mas só 4 pontuam. A briga real é no topo, e 3% cabem numa madrugada virada: há dias no histórico em que um único jogador queimou 300M+.
Índice
- Hoje (25/09): SEM DADO — nenhuma máquina reportou ainda.
- Base: 56.223.143 tokens/dia (média de 14 dias).
- Último reporte: 15/09, com 91.509.794. Silêncio desde 16/09 — décimo dia seguido.
- Pico do histórico: 28/08, com 1.387.695.061 em um dia (10 sessões, 3 jogadores).
O índice segue mudo há dez dias, o que por si só é pauta: ou o clube parou de queimar token, ou as máquinas pararam de reportar. Quando o número voltar, o desvio contra a base de 56M/dia vai dizer qual dos dois aconteceu. Ressalva honesta: amostra de 12 jogadores — um virando a noite move o índice inteiro, e o número de hoje é parcial, só sobe.