← JORNAL

Agente queima token, QA compila fatos e a caça à alucinação

Quebrar a parede do ambiente

Agentes de LLM para tarefa real — workflow de escritório, experimentação científica — precisam interagir repetidamente com o ambiente onde operam. O problema que o paper de hoje (2609.29773) aponta é que esse ambiente quase nunca está pronto para receber agente: a informação fica espalhada e fragmentada, a evidência relevante vem misturada com informação enganosa e versões conflitantes, e o ambiente evolui com o tempo, adicionando ruído novo e tarefas mais difíceis. Tudo isso degrada a performance do agente — não por culpa do modelo, mas do chão onde ele pisa.

A proposta do título é direta: evoluir os ambientes para auto-melhoria recursiva do agente, tratando o próprio ambiente como parte do loop de treinamento, e não como pano de fundo fixo. Em vez de só melhorar o modelo, melhora-se o campo de jogo para que a próxima rodada de treino tenha tarefas mais desafiadoras e menos ruído traiçoeiro.

Por que importa para o TOKEN CLUB: quem roda agente de código sabe que o gargalo caro não é o modelo errar na cara, é o agente perseguir a versão errada de um arquivo ou uma pista enganosa por dezenas de passos. Ambiente mal preparado é token queimado à toa — e é exatamente isso que infla o placar sem entregar resultado.

A QA que compila os fatos uma vez

A maioria dos sistemas de QA agentic faz a parte mais pesada do trabalho semântico no pior momento possível: toda vez que alguém pergunta. Quando o corpus tem revisões, rascunhos, revogações, deleções e fontes com níveis diferentes de autoridade, o modelo reconstrói o "estado atual governado" a cada leitura — e joga o trabalho fora logo em seguida, repetindo na próxima consulta. O paper (2609.29661) resume bem a analogia: é como um banco de dados que reconstrói a materialized view a cada SELECT.

A saída proposta é a compilação de fatos no momento da ingestão: em vez de recompor o estado do corpus por consulta, o sistema compila os fatos uma vez, quando o dado entra, e as perguntas passam a ler o resultado já consolidado. O ganho declarado no título é duplo: custo menor e confiabilidade maior em QA sobre corpora que mudam.

Por que importa: é o padrão clássico de engenharia (pagar o custo uma vez, na entrada) aplicado a agente. Para quem mede consumo de token, recompor estado a cada pergunta é o tipo de gasto invisível que só aparece na fatura — e que arquitetura de ingestão elimina na raiz.

Consistência multi-turno vira questão de sobrevivência

Agente que acerta tarefa isolada pode descarrilar ao longo de interação longa — e medir isso exige olhar a trajetória inteira, não o acerto pontual. O paper (2609.29508) faz exatamente isso: um cenário controlado de 20 passos, inspirado em estudos de gratificação adiada, em que a cada passo o agente escolhe entre continuar adiando uma recompensa ou reivindicá-la imediatamente. Sobre esse desenho, os autores cruzam visibilidade social (privado vs. público), estressores de persona e política de deliberação.

A escala impressiona: 84.540 trajetórias cobrindo 8 famílias de modelos, analisadas com análise de sobrevivência e uma taxonomia de razões de falha. Não é benchmark de "acertou ou errou": é medir quando e por quê o agente cede, o que importa justamente porque interação longa é o cenário real de qualquer agente em produção.

Por que importa: um agente que funciona 5 minutos e derrete na hora 3 é pior que um que erra rápido e para — porque o primeiro queima token fingindo que está tudo bem. Consistência temporal é métrica de custo, não só de qualidade.

Caçar "neurônio da alucinação" é mais difícil do que parece

A interpretabilidade de LLM virou terreno fértil para um tipo específico de claim: que certos conjuntos pequenos de neurônios detectam e causam comportamentos como recall factual, alinhamento de segurança e alucinação. São claims com implicações reais — auditoria de modelo, direcionamento de comportamento — mas o paper (2609.29781) nota que elas raramente são testadas contra os modos de falha conhecidos do probing esparso com regularização L1 em espaços de features correlacionados e de alta dimensionalidade.

A contribuição é um protocolo diagnóstico de cinco etapas, cobrindo correlação de features, baselines e outros controles, para separar "neurônio que causa alucinação" de artefato estatístico. É interpretabilidade com ceticismo de método — o tipo de verificação que falta quando o resultado é bom demais para ser verdade.

Por que importa: para quem usa LLM como juiz ou auditor de código, "achei o neurônio que alucina" é o tipo de ferramenta tentadora que, se não for validada direito, vira alavanca de decisão baseada em ruído. Protocolo de diagnóstico é o equivalente a teste de hipótese antes de publicar o ranking.


Status do TOKEN CLUB

Placar

  • 🥇 Kogu — 3.128.141.947 tokens
  • 🥈 Xepa — 3.035.251.037
  • 🥉 JOAO_AMORIM — 2.694.799.519
  • 4º Tetz — 302.210.242

Kogu segue na frente por 92.890.910 tokens (~3%) — menos de dois dias de média do clube. Os três primeiros estão na casa dos bilhões; o 4º cai para 302 milhões, um abismo de 2.392.589.277 tokens entre 3º e 4º. O clube tem 12 jogadores, mas só 4 pontuam — a briga real é no topo, e 3% cabem numa madrugada virada.

Índice

  • Hoje (25/09): SEM DADO — nenhuma máquina reportou ainda.
  • Base: 56.223.143 tokens/dia (média de 14 dias).
  • Último reporte: 15/09, com 91.509.794. Silêncio desde 16/09 — décimo dia seguido.
  • Pico do histórico: 28/08, com 1.387.695.061 em um dia (10 sessões, 3 jogadores).

O índice segue mudo há dez dias, o que por si só é pauta: ou o clube parou de queimar token, ou as máquinas pararam de reportar. Quando o número voltar, o desvio contra a base de 56M/dia vai dizer qual dos dois aconteceu. Ressalva honesta: amostra de 12 jogadores — um virando a noite move o índice inteiro, e o número de hoje é parcial, só sobe.

FONTES (4)