"IA — notícias de 2026-08-26"
Fontes
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
arXiv cs.CL — 2026-08-26
Capacidade do agente não depende só do modelo: o harness — gestão de memória, estratégia de planejamento, protocolo de ação e orquestração de tools/skills — pode dominar a contribuição do modelo base. O paper propõe JIT-Agent, que evolui o harness just-in-time por tarefa, automatizando desenho de harness antes considerado manual e não escalável. Resultados mostram ganhos de generalização ao otimizar harness em vez de apenas trocar modelo.
CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval
arXiv cs.AI/cs.CL — 2026-08-26
Bibliotecas de skills reutilizáveis permitem reuso de conhecimento procedural, mas acesso vira problema de retrieval. Prompting com biblioteca completa tem custo alto de contexto; retrieval vetorial ignora dependências entre skills. CaSKG propõe grafo causal-contrafactual de skills para retrieval escalável, modelando relações causais entre skills e seletividade contextual, reduzindo custo de contexto e melhorando cobertura.
TOPAS: Workflow-Aware Prefix-State Scheduling for Multi-Agent LLM Serving
arXiv cs.CL — 2026-08-26
Prefix caching em serving multi-agente cria tradeoff: manter cache KV longo acelera chamadas futuras, mas reduz memória GPU para batching concorrente. TOPAS propõe scheduler workflow-aware que gerencia estados de prefixo considerando estágios do workflow, priorizando retenção de caches relevantes para próximas chamadas do agente e liberando os demais para aumentar throughput.
AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs
arXiv cs.AI/cs.CL — 2026-08-26
Pipelines agênticos acumulam contexto longo via retrieval e tool-use, encarecendo inferência. Compressão degrada acurácia; speculative decoding acelera sem perda mas assume que drafter e verifier compartilham mesmo contexto. AsymSpec introduz decodificação especulativa assimétrica de contexto, permitindo drafter leve operar com contexto comprimido enquanto verifier valida com contexto completo.
Learning New Facts with QLoRA: An Acquisition-Retention Frontier
arXiv cs.CL — 2026-08-26
Fine-tuning eficiente com parâmetros é frequentemente assumido como preservador de capacidades por atualizar poucos parâmetros, mas a hipótese depende da capacidade do adaptador. Estudo com Qwen3-4B em benchmark geográfico derivado do OpenStreetMap mostra fronteira aquisição-retenção ao adquirir fatos anonimizados via QLoRA, mapeando como rank e dados afetam memorização sem esquecimento catastrófico.
When Personality Meets Quantization: A Layer-wise MBTI Analysis of Quantized LLMs
arXiv cs.CL — 2026-08-26
Personalidade em LLMs afeta confiança e engajamento; MBTI tem sido usado para avaliá-la, mas estudos focam modelos em precisão completa. O trabalho analisa efeitos da quantização camada a camada sobre traços MBTI, mostrando que compressão não é neutra: certas camadas são mais sensíveis e deslocam personalidade medida, com implicações para deployment quantizado de assistentes.
Reflection Steering: Disentangling Reflection from Reasoning in Activation Space for Token-Efficient Inference
arXiv cs.LG/cs.CL — 2026-08-26
Modelos de raciocínio longo geram traces com verificação e backtracking que desperdiçam tokens quando reflexão apenas re-verifica resultados já estabelecidos. Métodos atuais usam direção média derivada de labels, entrelaçando reflexão e raciocínio. O paper desembaraça reflexão de raciocínio no espaço de ativações, permitindo steering que reduz reflexão redundante e melhora eficiência de tokens na inferência.
Prefix Sliding for Efficient Test-Time Scaling
arXiv cs.CL/cs.AI — 2026-08-26
Test-time scaling melhora performance ao deixar o modelo raciocinar mais, mas manter todo o trace em memória via full attention torna tarefas com raciocínio longo caras. Prefix Sliding mostra que a maioria dos tokens intermediários perde importância ao longo do raciocínio, propondo deslizamento de prefixo que descarta ou comprime prefixos antigos para escalar compute de teste com custo controlado.
Skill Issue: Are Skills Language-Invariant in LLMs?
arXiv cs.CL — 2026-08-26
LLMs acessam conhecimento de forma inconsistente entre línguas, mas quão invariantes são suas skills? Via self-play multilíngue — duas instâncias do mesmo modelo interagindo — o estudo quantifica inconsistência de skills ortogonal a conhecimento e performance geral, revelando variação significativa de habilidades por língua com implicações para avaliação multilíngue e orquestração de agentes.
Beam Search, Self-Consistency, and the Limits of Inference-Time Scaling for Grammar-Constrained Text-to-SQL
arXiv cs.CL — 2026-08-26
Tradeoff clássico é reduzir tamanho do modelo e aumentar compute em inferência via beam mais largo. Em Text-to-SQL com saídas restritas por gramática, o paper examina até onde scaling de inferência (beam search, self-consistency) compensa modelos pequenos, delimitando retornos decrescentes e quando aumentar beam deixa de superar um modelo maior.
Ornith 1.5 35B-A3B Genesis Hermes GGUF — MoE vision 35B lançado em Hugging Face
Hugging Face — 2026-08-26
Modelo MoE 35B (3B ativos) baseado em Ornith-1.5-35B-A3B / Qwen3.5 MoE com capacidade vision multimodal e tuning Hermes agentic/function-calling. Publicado em 26/08 com variantes GGUF (APEX, APEX-Compact, Q8_0 e mmproj BF16) para inferência local via llama.cpp. Arquitetura image-text-to-text sob licença MIT, ampliando opções open-weight para serving quantizado e agentes tool-use.
Nota de cobertura: buscas nativas nos 10 idiomas (pt, en, it, es, fr, de, ru, zh, ko, ja) com foco em harness/skills/modelos LLM, inference, quantização, fine-tuning e arquitetura. Nenhum release com data verificável em 2026-08-26 foi encontrado para vLLM, llama.cpp ou lm-evaluation-harness (últimos releases: vLLM 0.27.0 em 2026-08-10, lm-eval v0.4.0 anterior). Papers arXiv em cs.CL/CS.AI/CS.LG/CS.CV dentre 71 no dia foram filtrados para engenharia de modelos/harness; softwares genéricos com IA foram excluídos. Hugging Face contribuiu com 1 modelo GGUF do dia.