← JORNAL

IA: LIDAR, auditoria de fontes, EnigmaForge e IndicBankBench

LIDAR: descobrir qual modelo está atrás do agente

Agente de código não roda o LLM "puro" — roda o modelo atrás de um harness que inspeciona repositório, invoca ferramenta e edita arquivo. Trocar o modelo por trás desse agente muda decisões de segurança: se ele verifica a própria mudança, se se recupera de falha, se confia no que acabou de escrever. O problema é que os fingerprints de LLM que existem inferem identidade a partir de texto direto ou distribuição de tokens — e, num agente de código, esses sinais chegam filtrados por system prompt, lógica do controlador, ferramentas e feedback de execução. A transferência é limitada.

O LIDAR (2609.28559) muda o alvo: em vez de olhar a prosa, olha a conduta. Identifica o modelo pela pegada que ele deixa ao decidir verificar uma mudança, se recuperar de uma falha ou tocar o repositório — identificação por comportamento agentic, não por token.

Por que importa: quem roda agente de código de terceiro raramente sabe qual modelo está de fato por trás. Com troca silenciosa de modelo virando risco de segurança — e de custo —, fingerprint comportamental vira peça de auditoria. No TOKEN CLUB, o token queimado também denuncia a máquina; saber qual modelo queimou é o passo seguinte.

A fonte que falta na resposta de busca

Resposta de busca generativa pode citar um trecho que existe e, ainda assim, omitir uma relação de fonte que muda a interpretação do que foi dito. Não é citação falsa — é citação incompleta que engana sem mentir.

O paper de hoje (2609.29145) especifica uma auditoria claim-gated do trio consulta–fonte–resposta. A omissão só é dada como resolvida quando quatro coisas são observadas juntas: a evidência da relação, a adoção daquela resposta, a materialidade e a divulgação. Evidência incompleta fica não resolvida — em vez de ser tratada como independência entre fontes. A especificação separa esse endpoint da checagem de citação e da prioridade de revisão, e amarra decisões a spans de evidência versionados.

Por que importa: é o tipo de falha que passa em todo teste do tipo "a citação bate com o trecho". Auditoria de fonte-relação mira exatamente o que a checagem superficial deixa escapar — e o que mais corrói a confiança em busca com IA.

EnigmaForge: o benchmark que esconde a pergunta

Quase todo benchmark entrega a pergunta de bandeja. O EnigmaForge (2609.30144) faz o contrário: entrega uma pilha de documentos antigos — cartas, recibos, margens de diário de bordo — e nenhuma pergunta. Enterrado ali existe um pequeno quebra-cabeça lógico cuja solução é única, provada por um SAT solver no momento da geração, com certificado de ablação mostrando que cada pista é necessária.

O que muda: como as instâncias são geradas e não coletadas, o corpus se renova indefinidamente — sem contaminação por treinamento. A métrica principal é intuição: acertar a tarefa tendo só a história, com a reconstrução de mundo como eixo secundário. O paper reporta resultados em 25 modelos de fronteira.

Por que importa: medir intuição e reconstrução — e não só resposta a pergunta formulada — está mais perto do jeito que agente real encontra problema em base de código e repositório, onde ninguém te entrega a pergunta pronta. E renovação infinita ataca o benchmark saturado de cor.

IndicBankBench: o erro que a resposta final esconde

Assistente bancário precisa usar informação específica da conta e, muitas vezes, agir por ferramentas. Avaliar só a resposta final deixa passar erros graves: pedir uma informação que já tem, apoiar-se em contexto velho, selecionar a conta errada, ou escrever um valor inválido depois de ter dito o correto.

O IndicBankBench (2609.29167) é um benchmark de 799 casos de varejo bancário indiano, cobrindo cinco domínios operacionais mais um domínio de capacidade/recusa, ao longo de vinte eixos primários. Os casos são avaliados em quatro estágios — a partir da segurança — em vez de um veredito único no fim.

Por que importa: é a transposição do "não basta a resposta final" para um setor onde o erro custa dinheiro real e tem regulação em cima. Banco está entre os primeiros a botar LLM em produção; benchmark estágio por estágio é o contraponto certo à checagem de gabarito.


Status do TOKEN CLUB

Placar

  • 🥇 Kogu — 3.128.141.947 tokens
  • 🥈 Xepa — 3.035.251.037
  • 🥉 JOAO_AMORIM — 2.694.799.519
  • 4º Tetz — 302.210.242

Kogu segue na frente por 92.890.910 tokens (~3%) — menos de dois dias de média do clube. São 12 jogadores, mas só 4 pontuam; o abismo entre 3º e 4º é de 2.392.589.277 tokens. A briga real é no topo, e 3% cabem numa madrugada virada.

Índice

  • Hoje (25/09): SEM DADO — nenhuma máquina reportou ainda.
  • Base: 56.223.143 tokens/dia (média de 14 dias).
  • Último reporte: 15/09, com 91.509.794. Silêncio desde 16/09 — décimo dia seguido.
  • Pico do histórico: 28/08, com 1.387.695.061 em um dia (10 sessões, 3 jogadores).

O índice mudo há dez dias segue sendo pauta: ou o clube parou de queimar token, ou as máquinas pararam de reportar. Quando o número voltar, o desvio contra a base de 56M/dia dirá qual dos dois aconteceu. Ressalva honesta: amostra de 12 jogadores — um virando a noite move o índice inteiro, e o número de hoje é parcial, só sobe.

FONTES (4)