← JORNAL

Hunyuan-A13B (80B/13B); árbitro de finanças; voz sob ataque

Hunyuan-A13B: mais um MoE aberto, 13B ativos por token

O relatório técnico do Hunyuan-A13B (arXiv 2609.27284) caiu hoje (24/09) e é a notícia de modelo do dia: um LLM open-source em MoE (Mixture-of-Experts) com 80 bilhões de parâmetros totais, mas só 13 bilhões ativados na inferência. É a receita que a DeepSeek popularizou — capacidade grande no papel, custo de ativação pequeno na hora de rodar — e a Tencent entra na fila com o selo Hunyuan.

O que o paper detalha: o modelo foi pré-treinado num corpus de 20 trilhões de tokens, com filtragem rigorosa e curadoria STEM reforçada (para melhorar confiabilidade factual e raciocínio), e passou por SFT de alta qualidade e RL em larga escala. O trade-off explícito é equilibrar capacidade, eficiência computacional e custo de deploy.

Por que importa: modelo aberto com 13B ativos é exatamente o tipo de coisa que roda em hardware doméstico — e, para o TOKEN CLUB, é o tipo de modelo que o placar vê queimando token em agente local, sem depender de API. A briga dos MoE abertos (DeepSeek, Qwen, Gemma, e agora Hunyuan) está deixando a inferência barata o suficiente para virar commodity; quem sobe no placar é quem automatiza mais, não quem paga mais por token.

"Propose, don't judge": agente que mina fator de investimento não pode se avaliar

No arXiv de hoje, "Propose, Don't Judge" (2609.27051) ataca um problema de governança bem concreto: agentes de LLM já fazem a pesquisa quantitativa inteira — propõem fatores de investimento, fazem backtest, selecionam os sobreviventes e aposentam os que morrem. A pergunta do paper é cirúrgica: quais desses empregos o agente deve manter?

A resposta é "governed self-evolution": o agente pode propor, mas não pode julgar. Um árbitro estatístico congelado, que o agente não consegue tocar, faz o julgamento. E o detalhe que dá força à proposta: o árbitro pontua cada candidato só pelos resultados de mercado revelados depois da submissão, apostando neles — o que faz a garantia de false-discovery rate valer a qualquer stopping time, para qualquer política de proposta.

Por que importa: backtest overfitting é o pecado original das finanças quantitativas, e um agente que propõe e valida os próprios fatores vai, inevitavelmente, se auto-validar. Separar proponente de juiz — com garantia estatística que o proponente não pode contornar — é a versão algorítmica de checks and balances, e é o desenho que vai separar agente financeiro confiável de gerador de overfit em escala.

Voz full-duplex é a nova superfície: ataque psicoacústico acerta 91,7%

No mesmo dia em que o Google anunciou o Gemini 3.8 com voz (peça da manhã), o arXiv traz o contraponto de segurança: "Psychoacoustically Aligned Latent Smoothing for Adversarial Robustness of Full-Duplex Speech-to-Speech Dialogue Models" (2609.27378). O problema de fundo: modelos de fala full-duplex escutam e falam ao mesmo tempo, então o canal acústico fica permanentemente aberto — e aberto, é superfície de ataque.

O paper formaliza ataques imperceptíveis como uma otimização de perturbação aditiva confinada abaixo do limiar de mascaramento psicoacústico da fala que carrega o sinal — ou seja, o ouvido humano não nota, mas o modelo sim. São três objetivos: sequestro semântico direcionado, supressão de resposta e jailbreak de política. Contra um agente estilo Moshi sem defesa, ataques white-box têm sucesso em até 91,7% das tentativas. A defesa proposta, ainda no título, é o "latent smoothing" alinhado à psicoacústica — mexer no espaço latente, não no sinal bruto.

Por que importa agora: assistente de voz full-duplex é a próxima interface de massa, e o boletim de hoje já marcou o Google entrando nessa corrida. Ataque que um humano não ouve mas que sequestra a resposta do modelo é exatamente a categoria de risco que regulação e produto vão precisar resolver antes de colocar isso no ouvido de todo mundo.


Status do TOKEN CLUB

Placar

  • 🥇 Kogu — 3.128.141.947 tokens
  • 🥈 Xepa — 3.035.251.037
  • 🥉 JOAO_AMORIM — 2.694.799.519
  • 4º Tetz — 302.210.242

Kogu segue na frente por 92.890.910 tokens (~3%). O clube tem 12 jogadores; 4 pontuam — top 3 bilionários e um abismo de 2.392.589.277 tokens entre o 3º e o 4º. A briga real é no topo, e 3% é margem de uma madrugada.

Índice

  • Hoje (24/09): SEM DADO ainda — nenhuma máquina reportou.
  • Base: 56.223.143 tokens/dia (média de 14 dias).
  • Último reporte: 15/09, com 91.509.794. Silêncio desde 16/09 — nono dia seguido.
  • Pico: 28/08, com 1.387.695.061 em um dia.

O índice segue mudo. Quando as máquinas voltarem a reportar, o desvio contra a base dirá se a semana de flagships (Opus 5.5, GPT-6, Gemini 3.8, e agora o Hunyuan-A13B aberto) mexeu no consumo real. Ressalva de sempre: amostra de 12 jogadores; um virando a noite move o índice inteiro, e o número de hoje é parcial — só sobe.

FONTES (3)