← JORNAL

Eval de LLM hospedado não replica; contexto longo envenena

Eval de LLM hospedado não replica — e pode mudar sem aviso

O arXiv de hoje (23/09) traz um paper que mexe direto com quem decide modelo olhando benchmark: "Replication Without Persistence in Hosted LLMs: Measurement Sensitivity in Action-Time Belief Evaluation" (arXiv 2609.22478). A pergunta do trabalho é simples e incômoda — se você roda o mesmo eval no mesmo endpoint identificado, o número volta igual?

Os autores separam a validação de um eval comportamental de LLM hospedado em três perguntas: (1) replicação — o achado anterior reaparece em dados novos sob a configuração histórica? (2) sensibilidade de medição — o endpoint muda quando a configuração de avaliação/inferência é reconstruída sob o mesmo identificador? (3) persistência — o achado se mantém entre identificadores testados depois, sob um instrumento comum?

A implicação prática é o que importa por aqui: o número de benchmark de um modelo hospedado pode mudar sem aviso e não replicar. Num dia em que a comunidade inteira está comparando Claude Opus 5.5 contra GPT-6 Sol e Luna em tabelas de benchmark, o recado é direto — quem roda eval (inclusive em Claude/GPT) deveria tratar o resultado como instável, não como verdade fixa. O modelo é uma esteira rolante; o benchmark é uma foto tirada num instante dela.

Contexto longo tem "envenenamento": lixo dilui a evidência

Outro paper de hoje (arXiv 2609.22101) ataca exatamente a direção que os laboratórios venderam ontem: contexto longo. O trabalho formula o que chama de "context poisoning" — interferência de valor extremo na atenção — e mostra que, quanto mais contexto irrelevante ou confuso você adiciona, pior fica a capacidade do modelo de localizar e usar a evidência decisiva.

O mecanismo é elegante: o score da evidência decisiva é limitado por cima, enquanto o score máximo entre os distratores cresce com o número de distratores. Sob uma abstração de recuperação por softmax, os autores derivam um bound de amostra finita mostrando que manter acurácia acima da taxa-base exige algo que o contexto gigante não dá de graça.

Isso dá o contraponto técnico ao Opus 5.5 de 1M de contexto lançado ontem: janela maior não é memória melhor. Despejar o repo inteiro no prompt não resolve nada se o modelo perde a agulha no palheiro — e o paper põe a matemática por trás dessa intuição. Para quem queima token com agente de código, a lição é de custo: contexto cheio não é só mais caro, é potencialmente menos preciso.

Agente de computer-use só "completa tarefa" não é seguro

O terceiro sinal do dia vem de "Beyond Task Completion: Training Capable and Safe Computer-Use Agents" (arXiv 2609.22178). O argumento: agentes de computer-use (CUAs) evoluíram rápido em completar tarefas via interface gráfica, mas pós-treino centrado só em sucesso de tarefa não induz comportamento seguro confiável.

A proposta dos autores é condicionar a execução ao risco. Um CUA confiável deve: completar tarefas benignas normais, evitar perigos ambientais e continuar quando existe um caminho seguro, e recusar quando o objetivo é danoso ou não há caminho seguro. Para treinar essa política condicional, eles apresentam o SCOPE (Safety and Capability Optimization for Policy Execution).

Por que isso importa hoje: na mesma janela em que o Muse da Meta apareceu com 0-day grave e superprivilégios sobre o aparelho, e em que o Pentágono admitiu excesso de confiança em IA numa decisão letal, o paper desloca a pergunta de segurança. Não é só "o agente fez a tarefa?" — é "o agente soube recusar quando deveria?". Para quem delega o terminal a um agente, essa é a diferença entre ferramenta e risco.


Status do TOKEN CLUB

Placar

  • 🥇 Kogu — 3.128.141.947 tokens
  • 🥈 Xepa — 3.035.251.037
  • 🥉 JOAO_AMORIM — 2.694.799.519
  • 4º Tetz — 302.210.242

Kogu segue na frente por 92.890.910 tokens (3,06%). O clube tem 12 jogadores; 4 pontuam — o top 3 na casa dos bilhões e um abismo de 2.392.589.277 tokens entre o 3º e o 4º. A disputa de verdade é no topo, e 3% cabem numa madrugada virada.

Índice

  • Hoje (23/09): SEM DADO — nenhuma máquina reportou até agora.
  • Base: 56.223.143 tokens/dia (média de 14 dias).
  • Últimos reportes: 14/09 fez 335.129.583; 15/09 fez 91.509.794. Silêncio desde 16/09 — oitavo dia seguido.
  • Régua: 12/09 fez 511.858.277; o pico segue sendo 28/08, com 1.387.695.061 em um dia.

O índice — o único dado que nenhuma outra publicação tem — segue mudo justamente na janela em que Opus 5.5 e GPT-6 chegaram ao default. Quando as máquinas voltarem a reportar, o desvio contra a base vai dizer se a troca de flagship mexeu no consumo real. Ressalva honesta: amostra de 12 jogadores; um virando a noite move o índice inteiro, e o número de hoje é parcial — só sobe.

FONTES (3)