Pular para o conteúdo principal

"IA — notícias de 2026-08-26"

· 5 min para ler

Fontes

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

arXiv cs.CL — 2026-08-26

Capacidade do agente não depende só do modelo: o harness — gestão de memória, estratégia de planejamento, protocolo de ação e orquestração de tools/skills — pode dominar a contribuição do modelo base. O paper propõe JIT-Agent, que evolui o harness just-in-time por tarefa, automatizando desenho de harness antes considerado manual e não escalável. Resultados mostram ganhos de generalização ao otimizar harness em vez de apenas trocar modelo.

Abrir fonte

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval

arXiv cs.AI/cs.CL — 2026-08-26

Bibliotecas de skills reutilizáveis permitem reuso de conhecimento procedural, mas acesso vira problema de retrieval. Prompting com biblioteca completa tem custo alto de contexto; retrieval vetorial ignora dependências entre skills. CaSKG propõe grafo causal-contrafactual de skills para retrieval escalável, modelando relações causais entre skills e seletividade contextual, reduzindo custo de contexto e melhorando cobertura.

Abrir fonte

TOPAS: Workflow-Aware Prefix-State Scheduling for Multi-Agent LLM Serving

arXiv cs.CL — 2026-08-26

Prefix caching em serving multi-agente cria tradeoff: manter cache KV longo acelera chamadas futuras, mas reduz memória GPU para batching concorrente. TOPAS propõe scheduler workflow-aware que gerencia estados de prefixo considerando estágios do workflow, priorizando retenção de caches relevantes para próximas chamadas do agente e liberando os demais para aumentar throughput.

Abrir fonte

AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs

arXiv cs.AI/cs.CL — 2026-08-26

Pipelines agênticos acumulam contexto longo via retrieval e tool-use, encarecendo inferência. Compressão degrada acurácia; speculative decoding acelera sem perda mas assume que drafter e verifier compartilham mesmo contexto. AsymSpec introduz decodificação especulativa assimétrica de contexto, permitindo drafter leve operar com contexto comprimido enquanto verifier valida com contexto completo.

Abrir fonte

Learning New Facts with QLoRA: An Acquisition-Retention Frontier

arXiv cs.CL — 2026-08-26

Fine-tuning eficiente com parâmetros é frequentemente assumido como preservador de capacidades por atualizar poucos parâmetros, mas a hipótese depende da capacidade do adaptador. Estudo com Qwen3-4B em benchmark geográfico derivado do OpenStreetMap mostra fronteira aquisição-retenção ao adquirir fatos anonimizados via QLoRA, mapeando como rank e dados afetam memorização sem esquecimento catastrófico.

Abrir fonte

When Personality Meets Quantization: A Layer-wise MBTI Analysis of Quantized LLMs

arXiv cs.CL — 2026-08-26

Personalidade em LLMs afeta confiança e engajamento; MBTI tem sido usado para avaliá-la, mas estudos focam modelos em precisão completa. O trabalho analisa efeitos da quantização camada a camada sobre traços MBTI, mostrando que compressão não é neutra: certas camadas são mais sensíveis e deslocam personalidade medida, com implicações para deployment quantizado de assistentes.

Abrir fonte

Reflection Steering: Disentangling Reflection from Reasoning in Activation Space for Token-Efficient Inference

arXiv cs.LG/cs.CL — 2026-08-26

Modelos de raciocínio longo geram traces com verificação e backtracking que desperdiçam tokens quando reflexão apenas re-verifica resultados já estabelecidos. Métodos atuais usam direção média derivada de labels, entrelaçando reflexão e raciocínio. O paper desembaraça reflexão de raciocínio no espaço de ativações, permitindo steering que reduz reflexão redundante e melhora eficiência de tokens na inferência.

Abrir fonte

Prefix Sliding for Efficient Test-Time Scaling

arXiv cs.CL/cs.AI — 2026-08-26

Test-time scaling melhora performance ao deixar o modelo raciocinar mais, mas manter todo o trace em memória via full attention torna tarefas com raciocínio longo caras. Prefix Sliding mostra que a maioria dos tokens intermediários perde importância ao longo do raciocínio, propondo deslizamento de prefixo que descarta ou comprime prefixos antigos para escalar compute de teste com custo controlado.

Abrir fonte

Skill Issue: Are Skills Language-Invariant in LLMs?

arXiv cs.CL — 2026-08-26

LLMs acessam conhecimento de forma inconsistente entre línguas, mas quão invariantes são suas skills? Via self-play multilíngue — duas instâncias do mesmo modelo interagindo — o estudo quantifica inconsistência de skills ortogonal a conhecimento e performance geral, revelando variação significativa de habilidades por língua com implicações para avaliação multilíngue e orquestração de agentes.

Abrir fonte

Beam Search, Self-Consistency, and the Limits of Inference-Time Scaling for Grammar-Constrained Text-to-SQL

arXiv cs.CL — 2026-08-26

Tradeoff clássico é reduzir tamanho do modelo e aumentar compute em inferência via beam mais largo. Em Text-to-SQL com saídas restritas por gramática, o paper examina até onde scaling de inferência (beam search, self-consistency) compensa modelos pequenos, delimitando retornos decrescentes e quando aumentar beam deixa de superar um modelo maior.

Abrir fonte

Ornith 1.5 35B-A3B Genesis Hermes GGUF — MoE vision 35B lançado em Hugging Face

Hugging Face — 2026-08-26

Modelo MoE 35B (3B ativos) baseado em Ornith-1.5-35B-A3B / Qwen3.5 MoE com capacidade vision multimodal e tuning Hermes agentic/function-calling. Publicado em 26/08 com variantes GGUF (APEX, APEX-Compact, Q8_0 e mmproj BF16) para inferência local via llama.cpp. Arquitetura image-text-to-text sob licença MIT, ampliando opções open-weight para serving quantizado e agentes tool-use.

Abrir fonte

Nota de cobertura: buscas nativas nos 10 idiomas (pt, en, it, es, fr, de, ru, zh, ko, ja) com foco em harness/skills/modelos LLM, inference, quantização, fine-tuning e arquitetura. Nenhum release com data verificável em 2026-08-26 foi encontrado para vLLM, llama.cpp ou lm-evaluation-harness (últimos releases: vLLM 0.27.0 em 2026-08-10, lm-eval v0.4.0 anterior). Papers arXiv em cs.CL/CS.AI/CS.LG/CS.CV dentre 71 no dia foram filtrados para engenharia de modelos/harness; softwares genéricos com IA foram excluídos. Hugging Face contribuiu com 1 modelo GGUF do dia.