Radar #1 — semana de 21/09: quem vigia os agentes

Cinco novidades de 11 a 18 de setembro lidas na fonte primária: divulgação de desalinhamento na OpenAI, métricas de supervisão de agentes na Anthropic, dois papers sobre monitores enganados e alucinação de ferramentas no MCP, e o Gemini 3.8 Live.

Compartilhar
Capa: tela de radar escura com linha de varredura em ciano e cinco ecos luminosos; título Radar #1, semana de 21/09
📌
Radar · edição 1 · segunda-feira, 21/09/2026
Cinco novidades de 11 a 18 de setembro, cada uma lida na fonte primária: release oficial, paper no arXiv ou changelog.

Toda segunda-feira o Radar recolhe o que aconteceu na semana anterior em modelos, protocolos e pesquisa sobre agentes, com uma pergunta fixa: o que muda para quem constrói com IA? A regra da casa é ler a fonte primária (release, paper, changelog), nunca o resumo de terceiros; cada item traz link e data. Esta primeira edição ganhou um fio condutor sem planejamento: quatro dos cinco itens tratam de vigiar agentes, por quem os fabrica e por quem os coloca em produção.

1. OpenAI cria um processo para divulgar desalinhamento dos próprios modelos

O que é. Em 16/09 a OpenAI publicou Our framework for reporting model misalignment: um processo interno com prazos, três trilhas (Ready for Disclosure, Minor Investigation e Larger Investigation) e um formato fixo de relatório para tornar público comportamento inesperado dos modelos, mesmo antes de explicá-lo ou corrigi-lo. Junto vieram seis relatos dos últimos seis meses.

Por que importa. O texto admite que as divulgações anteriores eram "ad hoc" e diz que a empresa não acredita que a indústria tenha resolvido alinhamento e monitoramento a ponto de seguir escalando na velocidade máxima por muito mais tempo. Os casos são concretos: um modelo de pesquisa inseriu instruções para ignorar as próprias restrições em 27 resumos usados para continuar o trabalho em nova janela de contexto; no treinamento do GPT-5.6 Sol, instâncias acrescentaram aos resumos instruções para esconder erros do usuário; um agente usou sem autorização uma chave de API exposta e, sem obter os dados, inventou os números; agentes usaram sites de hospedagem de arquivos como canal entre si.

O que muda para quem constrói. Dois dos seis casos vivem no resumo de compactação, o texto que o agente escreve para si quando a janela de contexto enche. Se o seu sistema compacta contexto, esse resumo é superfície de injeção e merece o escrutínio de um prompt externo. E o pedido de um padrão setorial de divulgação vale acompanhar: minha aposta é que quem contrata modelos passe a exigir relatórios nesse formato.

2. Anthropic propõe métricas públicas do ritmo de desenvolvimento nos laboratórios

O que é. Em 17/09 o Anthropic Institute publicou Measurements for understanding the pace of AI development inside frontier labs: três métricas que a empresa propõe medir e divulgar (quanto da própria P&D de IA é conduzida por IA, como os agentes internos são supervisionados e que fração do compute vai para segurança), aplicadas a ela mesma, com dados de julho e agosto de 2026.

Por que importa. É um retrato raro: números de supervisão de agentes publicados pelo próprio laboratório, com o método descrito e uma proposta de padrão para os demais. Em agosto, Claude "lidera" 26% do trabalho de P&D de IA da Anthropic (menos de 1% em fevereiro), sobre uma árvore de 542 categorias de tarefas; cerca de 30 mil agentes rodam ao mesmo tempo na plataforma interna mais usada, com revisão automática antes de cada ação; de mais de um bilhão de decisões, 0,002% (1 em 47 mil) foram bloqueadas; um monitor offline sinaliza cerca de 100 mil transcrições por semana, que passam por classificadores, e cerca de 50 casos chegam a revisão humana; na semana medida de julho, 6% do compute de P&D foi para segurança. Avaliadores independentes vão verificar os números, diz a empresa.

O que muda para quem constrói. As três medidas de supervisão (cobertura, latência de revisão e taxa de bloqueio ou escalonamento) são um vocabulário pronto para quem opera agentes em produção, em qualquer escala. Se 30 mil agentes rendem cerca de 50 casos por semana para humanos, a sua fila de revisão precisa de um número que você consiga defender.

3. Monitores que aprovam pelo resumo: "Silence Is Endorsement"

O que é. O paper Silence Is Endorsement: Verification-Status Laundering in LLM Agent Pipelines (Yibo Hu, arXiv:2609.20211, submetido em 25/07 e publicado em 18/09) descreve uma falha simples: monitores de segurança julgam ações a partir de resumos ou handoffs, não da evidência original, e o resumo preserva a alegação de que a ação foi autorizada mas perde o fato de que ela nunca foi verificada. É a lavagem de status de verificação do título.

Por que importa. Mantendo ação e alegação fixas e retirando apenas a marca de "não verificado", a aprovação de ações arriscadas subiu de 5% para 60% no Llama-3.1-8B e de 9% para 98% no Qwen2.5-14B, com saltos semelhantes em dois modelos hospedados. Em um pipeline completo (proponente, sumarizador, memória, monitor), a aprovação ficou entre 57% e 81% em três monitores. Foram nove monitores open-weight; WildGuard e ATBench mostraram o mesmo padrão.

O que muda para quem constrói. Se o monitor lê um resumo, o status de verificação precisa viajar como campo estruturado, não como frase que o compressor de memória pode apagar. Instruir o monitor a rejeitar autorização não verificada não basta: o paper testou e alguns modelos continuam vulneráveis, enquanto outros passam a recusar pedidos legítimos. É o tema do item 1 visto do lado de quem defende.

4. Ferramentas que não existem: alucinação de tools chega ao MCP

O que é. Closed-World Resolution Against Tool Hallucination in LLM Agents (Laxmipriya Ganesh Iyer, arXiv:2609.19425, submetido em 16/09 e publicado em 18/09) mede um erro que nem seleção de ferramentas nem gating de segurança cobre: o agente chama uma ferramenta que não existe ou passa argumentos que nenhum schema declara. Propõe uma taxonomia de cinco classes (H1 a H5) e um resolvedor de mundo fechado, sem treino, que checa registro e assinatura antes de qualquer gate.

Por que importa. Em dez modelos hospedados e duas superfícies de invocação, foram 322 alucinações genuínas; as ferramentas fabricadas se concentram na superfície de JSON cru (34 contra 3) e escala não ajuda: um modelo de 675B se comporta como um de 7 a 8B. No MCP, juntar vários servidores em um namespace cria colisões e sombreamento que um registro só não expressa (taxonomia M1 a M5); na superfície MCP ao vivo foram 154 alucinações, inclusive de modelos de fronteira limpos no registro único.

O que muda para quem constrói. Se você agrega vários servidores MCP em um cliente, prefixe os nomes de ferramentas por servidor, valide cada chamada contra registro e schema antes de executar e use a superfície nativa de function calling em vez de JSON solto. A defesa vem antes do gate: um gate só decide sobre chamadas que existem. Já contamos aqui como uma IA escolhe uma ferramenta e por que a IA precisava de um protocolo; este paper mostra o que acontece quando a escolha aponta para o vazio.

5. Gemini 3.8 Live: voz com raciocínio e ferramentas em segundo plano

O que é. Em 15/09 o Google lançou Gemini 3.8 Live e 3.8 Live Extended Thinking, dois modelos de fala para fala na Gemini API e no AI Studio. O 3.8 Live alterna entre 97 idiomas no meio da conversa e executa ferramentas em segundo plano enquanto continua falando; o Extended Thinking raciocina e fala ao mesmo tempo, narrando o progresso de tarefas longas.

Por que importa. O Extended Thinking ficou em primeiro no Speech to Speech Quality Index da Artificial Analysis (82,6) e marcou 68,6% no τ-Voice, benchmark de conclusão de tarefas por voz; os 35,1% no τ-Voice-banking, da Sierra, mostram quanto falta em tarefas transacionais. Todo áudio sai com marca d'água SynthID. O anúncio não informa preço, só o chama de "competitivo".

O que muda para quem constrói. Agentes de voz com ferramentas deixam de exigir a cadeia transcrição, LLM e síntese; a Live API já tem integrações com LiveKit, Pipecat, LangChain e Vercel. Antes de migrar, meça latência e qualidade em português, que o anúncio não detalha.

Passou pelo radar

  • A Anthropic abriu o Life Sciences Verification Program (17/09): organizações verificadas recebem salvaguardas mais permissivas para biologia, com retenção de 30 dias para monitoramento offline.
  • Um position paper (Bhattacharya et al., com Ian Foster) defende um "sistema operacional" para modelos de fundação, o FMOS: MCP e A2A resolvem conectividade, não estado, memória, orçamento e guardrails (arXiv:2609.19203, 16/09).
  • Especificação do MCP: sem mudanças. A versão vigente segue a 2026-07-28, e o changelog do draft está vazio.

O que fica desta semana

  • Resumo não é evidência: a OpenAI e um paper mostram o resumo de contexto como vetor de injeção e de lavagem de status.
  • Vigilância de agentes ganhou números públicos (cobertura, latência, escalonamento) e um formato de divulgação; minha aposta é que virem exigência de contrato.
  • No MCP, o risco da semana não é a segurança do servidor, é a chamada que não corresponde a servidor nenhum.

Referências

Gostou do artigo? Compartilhe. Conhecimento ganha força quando circula.