← JORNAL

Agentes IA: tool call alucinada, dark patterns e overthinking

Chamada de ferramenta alucinada: o ponto cego que nenhum gate enxerga

Quem roda agente com Claude Code e MCP conhece o sintoma: o agente invoca uma ferramenta que não existe ou passa um argumento que nenhum schema declara. O paper da vez (arXiv 2609.19425) dá nome e mecanismo a isso — e mostra que é pior do que bug de prompt.

O que mudou: as defesas atuais se dividem em duas famílias. A seleção de ferramenta escolhe a ferramenta certa para a intenção; o gating restringe o uso de ferramentas reais. As duas partem da mesma premissa — a chamada se refere a uma ferramenta real. O trabalho mostra que aí mora um ponto cego estrutural: uma chamada alucinada não é uma decisão que algum gate tomou, então nenhum gate pode rejeitá-la. O agente inventa uma ferramenta fora do schema, e as travas ficam olhando para o lugar errado. É um trabalho primariamente de medição, que propõe uma resolução "closed-world".

Por que importa: tool call é a fronteira entre o agente e o mundo. Se a falha é de referência e não de escolha, ela passa por baixo de quem só policia ferramenta real. Para quem monta agente em produção, é o argumento para tratar o schema de ferramentas como contrato fechado — não como sugestão.

Agente clicando em interface herda as armadilhas feitas para humanos

Interfaces são desenhadas para humanos — inclusive para nos empurrar na direção de clicar, comprar, aceitar. A pergunta nova: o que acontece quando quem navega é um agente?

O que mudou: o estudo "A Dual-Process Perspective on Nudge Susceptibility in LLM-Based GUI Agents" (arXiv 2609.19843) olha para o agente que percebe a tela e executa a ação, em vez de olhar só o texto que o modelo gera. Viés comportamental em saída textual de LLM já é bem documentado; o que faltava era entender como a influência opera quando o modelo age — e se o raciocínio embutido nos agentes deixa eles mais ou menos suscetíveis ao nudge. A lente é a do processo dual: o atalho rápido contra a deliberação.

Por que importa: um agente que compra, agenda ou assina no seu lugar herda os dark patterns desenhados para a psicologia humana. Se raciocinar mais não blinda contra o botão de "aceito os termos", o agente vira um usuário novo — sem os freios que a gente aprendeu a ter. Para quem solta agente em browser, é mais uma camada de risco que não estava no manual.

O overthinking cobra caro: When2Think ataca o desperdício de raciocínio

Modelo de raciocínio resolve problema difícil, mas tem um vício de fábrica: pensa demais no fácil e de menos no difícil. Cada token de "pensar" é token queimado — e, no placar do TOKEN CLUB, é exatamente o que se conta.

O que mudou: o When2Think (arXiv 2609.19671) trata raciocínio eficiente como alocação de computação adaptada à instância. As saídas atuais ou aplicam penalidade de comprimento uniforme ou roteiam de forma rígida — e pagam um "imposto de eficiência": economizam no fácil mas perdem acurácia no difícil. O framework pós-treino aloca dinamicamente o esforço conforme a dificuldade, em vez de um tamanho único para tudo.

Por que importa: raciocínio é a linha de custo mais elástica de um agente. Um modelo que pensa a mesma quantidade para "2+2" e para uma refatoração de mil linhas queima dinheiro no trivial e erra no que importa. Alocação sensível à dificuldade é, no fundo, controle de custo por pergunta — a mesma conta que todo mundo faz antes de apertar enter.

Status do TOKEN CLUB

Placar

  • 🥇 Kogu — 3.128.141.947 tokens
  • 🥈 Xepa — 3.035.251.037
  • 🥉 JOAO_AMORIM — 2.694.799.519
  • Tetz — 302.210.242

A distância Kogu–Xepa segue em ~92,9 milhões de tokens (3,06%). O top 3 continua numa liga própria: JOAO_AMORIM está 340,5 mi atrás do 2º, e Tetz aparece a 2,39 bilhões do 3º. São 11 jogadores no clube; 4 pontuam.

Índice

  • Hoje (18/09): sem dado ainda — nenhuma máquina reportou.
  • 16 e 17/09: passaram em branco, sem reporte.
  • Último dado: 15/09, com 91.509.794 tokens (1 sessão, 1 jogador).
  • Dia normal: 56.223.143 tokens (média de 14 dias).

Três dias seguidos de silêncio. A régua do histórico não perdoa: 28/08 fez 1,39 bilhão e 20/08 fez 1,52 bilhão — uma noite virada dessas apaga a vantagem de ~93 mi do Kogu de uma vez. O clube segue morno; quem aparecer para queimar token hoje decide o placar.

FONTES (3)