Radar #3 — semana de 05/10: o preço empatou, a cerca não
Cinco novidades de 28 a 30 de setembro lidas na fonte primária: Sonnet 5.5, GPT-6.1 Sol e Gemini 4 Argon no mesmo preço, o GLM-5.3 e o exploit em pesos abertos, a destilação de raciocínio e um paper sobre bloquear sem desativar em multiagentes.
Em três dias, três laboratórios puseram um modelo na mesma etiqueta: 2 dólares por milhão de tokens de entrada e 10 de saída. Depois de quem vigia o agente (Radar #1) e de onde mora a garantia (Radar #2), o fio desta edição é o que cada um cerca quando o preço empata: quem tem acesso, o que o modelo recusa e quem consegue copiar o raciocínio.
1. Sonnet 5.5 e GPT-6.1 Sol: o meio da tabela pela mesma etiqueta
O que é. Em 28/09 a Anthropic lançou o Claude Sonnet 5.5. Custa o mesmo que o Sonnet 5 (em dólares, por milhão de tokens: 2 de entrada, 10 de saída, 0,20 de leitura de cache); segundo a empresa, é mais de 30% mais rápido e gasta até 30% menos por tarefa. No dia seguinte, a OpenAI lançou o GPT-6.1 Sol, que "quase alcança" o GPT-6 Astra por um quinto do preço dele: 2 de entrada, 10 de saída e 0,10 de entrada em cache.
Por que importa. Nenhum dos dois se compara com o outro. Na tabela da Anthropic, o Sonnet 5.5 fica à frente do GPT-6 Sol, a versão anterior ao 6.1, em trabalho de conhecimento, e no Terminal-Bench 4.0 marca 70,6%, acima dos 66,4% do Opus 5.5 (com esforços que podem diferir); a empresa ressalva que o Opus continua mais forte em trabalho complexo e aberto, que exige julgamento sustentado. Nos números da OpenAI, o GPT-6.1 Sol supera o Opus 5.5, que custa o dobro por token, no AutomationBench (2,2 pontos, em esforço médio, por cerca de um terço do custo) e no GDP.pdf (contra o Opus com fallbacks), por menos da metade do custo por tarefa. No cache, a OpenAI cobra metade.
O que muda para quem constrói. O que separa os dois é o custo por tarefa no seu caso, que depende do nível de esforço. O Sonnet 5.5 é o primeiro Sonnet com salvaguarda de ciber: tarefa de risco alto cai, de forma visível, para o Sonnet 5. O 6.1 Sol já está na API como gpt-6.1-sol e, nos planos pagos, no ChatGPT Work e no Codex; ainda não no Chat.
2. Gemini 4 Argon: fronteira anunciada, acesso em fila
O que é. Em 30/09 o Google anunciou o Gemini 4 Argon, seu novo modelo de fronteira, liberado primeiro para defensores de cibersegurança de confiança. O preço de lançamento é o mesmo: 2 e 10 dólares, com 95% de desconto no cache. O limite de saída sobe de 64 mil para 1 milhão de tokens por resposta.
Por que importa. Nos números do Google, o Argon marca 77,9% no DeepSWE v1.1 e 51,3% no AutomationBench, primeiro lugar nos dois. A liberação é a parte nova. Defensores de confiança e equipes internas recebem o modelo sem as barreiras de ciber; o resto espera, enquanto o Google participa do processo voluntário do governo dos EUA de acesso antes do lançamento. O Google também monitora o raciocínio e as ações do modelo e interrompe a execução quando necessário, e pede ao setor que preserve a transparência do raciocínio.
O que muda para quem constrói. Por ora, nada que se possa usar: não há data, só a ordem (clientes pagos da API e assinantes do AI Ultra primeiro), e o preço é "introdutório".
3. GLM-5.3: o exploit chegou aos pesos abertos
O que é. Em 29/09 o Frontier Red Team da Anthropic publicou uma análise do GLM-5.3, da Zhipu AI (Z.ai), modelo de pesos abertos. No ExploitBench, ele montou exploits completos em 50 de 410 tentativas; o Claude Mythos Preview, em 56. Num teste interno de exploração de binários, 4% contra 6%; o Opus 4.6 e o GLM-5.2 zeraram.
Por que importa. Nos testes da Anthropic, as travas do GLM-5.3 caem com técnicas simples: uma história de fachada faz o modelo se engajar em 64% dos pedidos maliciosos no ambiente simulado, preencher o início do raciocínio leva a 92%, e a versão sem recusas a 100%. Remover as recusas custou à equipe cerca de 2.200 horas de GPU, uns 4.400 dólares. Desconto: quem assina é concorrente e defende o modelo fechado, que não pode ser alterado assim. Mas a avaliação do CAISI, do NIST (17/09), confirma a parte de capacidade (as travas não foram testadas): é o modelo aberto mais capaz em ciber até hoje, embora "significativamente abaixo" da fronteira dos EUA, cerca de quatro meses atrás. E a própria Anthropic reconhece que a mesma capacidade serve a quem defende.
O que muda para quem constrói. Trate a capacidade de exploit como disponível a qualquer um. Num dos testes, o GLM-5.3-Flash transformou uma correção pública do Chrome em cadeia de exploit com 20 minutos de atenção humana e oito horas de modelo. Aplique patch mais rápido.
4. Destilação: o raciocínio virou ativo a proteger
O que é. Em 30/09 a OpenAI relatou ter desarticulado uma campanha para extrair o raciocínio protegido dos seus modelos, iniciada em 1º de julho. O pico, em 24 e 25/07, somou 16 mil requisições de mais de 4 mil usuários; o grupo inteiro, de mais de 15 mil, foi desarticulado até 28/07. Uma das técnicas copiava o raciocínio criptografado de uma conversa e pedia ao modelo, em outra, que o decifrasse; os operadores não quebraram a criptografia.
Por que importa. Raciocínio extraído pode treinar outro modelo sem as salvaguardas do original. A OpenAI atribui o núcleo da campanha a pessoas ligadas à Moonshot AI, que desenvolve o Kimi, e diz não saber se todos os operadores eram um só ator. A empresa ressalva que a técnica não é exclusiva dos seus modelos e que compartilhou o que achou com outros laboratórios pelo Frontier Model Forum. Na mesma semana, o Sonnet 5.5 saiu com classificadores contra extração de raciocínio e com o "preserved thinking" ampliado.
O que muda para quem constrói. No Claude, o raciocínio ficou preso à conta que o gerou; a OpenAI reforçou a proteção entre usuários, workspaces e organizações e avisa que sistemas com raciocínio portátil ou reaproveitável podem ter riscos parecidos. Se o seu sistema move conversas entre contas, workspaces ou provedores, teste antes de atualizar.
5. Negar sem desativar: o bloqueio e a entrega na mesma métrica
O que é. O paper Deny Without Disabling (Zhang et al., arXiv:2610.00371, submetido em 30/09) trata de um risco dos sistemas multiagente: partes que passam pela checagem uma a uma podem, juntas, reconstruir o que é proibido. A avaliação proposta só conta como sucesso bloquear o uso proibido e, ao mesmo tempo, concluir o autorizado; a implementação, o FlowReview, liga identificação do objeto, hierarquia de permissões e aplicação determinística da regra.
Por que importa. Nos experimentos controlados, checar cada artefato isoladamente deixou passar 413 de 480 commits proibidos (86%). Revisar a união dos artefatos deixou passar zero, e os dois arranjos entregaram 459 de 480 objetos autorizados. Os testes usam cinco modelos, de Sonnet 4.5 a Llama-3.3-70B, e casos sintéticos; a confirmação em tarefas derivadas do AgentDojo cobre só o Sonnet 4.5.
O que muda para quem constrói. Cerca que só bloqueia é fácil; difícil é a que bloqueia e ainda entrega. Revise o que vai ser executado, já montado, e não cada mensagem. E ponha a decisão crítica num componente determinístico, cuja saída se possa verificar.
Passou pelo radar
- A OpenAI publicou (28/09) diretrizes iniciais de safety cases para treinamento de fronteira, entre elas não deixar os avaliadores automáticos verem a cadeia de raciocínio e guardar transcrições de forma imutável.
- Especificação do MCP: sem versão nova; segue a 2026-07-28, e o changelog do draft continua vazio.
O que fica desta semana
- O preço empatou em 2 e 10 dólares. Compare custo por tarefa, no seu caso, e repare em com quem cada anúncio se comparou.
- A capacidade de exploit está em pesos abertos: num teste da Anthropic, um patch público virou cadeia de exploit em oito horas de modelo e cerca de 20 dólares. O seu tempo de correção precisa acompanhar.
- No Claude, o raciocínio ficou preso à conta que o gerou, e a OpenAI avisa que raciocínio portátil ou reaproveitável é superfície de ataque. Não construa contando com levá-lo de um lugar para outro.
Referências
- ANTHROPIC. Introducing Claude Sonnet 5.5. 28 set. 2026.
- OPENAI. Introducing GPT-6.1 Sol. 29 set. 2026.
- GOOGLE. Gemini 4 Argon: our next era of frontier intelligence. The Keyword, 30 set. 2026.
- FASANO, Andrew; FLEISCHER, Marius; McFAUL, Cole; XIAO, Robert; GALLAGHER, Tripp. GLM-5.3 and the spread of advanced cyber capabilities. Anthropic, 29 set. 2026.
- NIST CENTER FOR AI STANDARDS AND INNOVATION (CAISI). CAISI's assessment of Z.ai's GLM-5.3 cyber capabilities. 17 set. 2026.
- OPENAI. Disrupting a coordinated model-distillation campaign. 30 set. 2026.
- ZHANG, Yunbei; LYU, Saiyue; WANG, Janet; GE, Yingqiang; GUO, Jiang; HAMM, Jihun; REDDY, Chandan K. Deny Without Disabling: Authorization-Paired Evaluation and Control for Multi-Agent Systems. arXiv:2610.00371, submetido em 30 set. 2026.
- OPENAI. Towards safety cases for frontier AI training. 28 set. 2026.
- MODEL CONTEXT PROTOCOL. Specification 2026-07-28: Key Changes. Acesso em 2 out. 2026.
