IA — notícias de 2026-08-24
Fontes
Prime Agent: A Self-Improving RLM Harness
arXiv · 2026-08-24 Harness open-source para avaliação de longo horizonte e workflows de coding agents. Propõe abstração Recursive Language Model com REPL IPython persistente para processamento programático de contexto e compute em tempo de teste, além de Continual Harness que preserva históricos, memórias, skills e especificações de subagentes entre trajetórias. Subagentes recursivos coordenam-se por comunicação direta agente-a-agente com visão unificada de execução. Abrir fonte
SkillAlchemy: Open-World Agent Skill Creation
arXiv · 2026-08-24 Estuda criação de skills em mundo aberto, onde um criador deve descobrir requisitos omitidos pelo briefing a partir de materiais externos. Diferente de geração dependente de autoria humana ou traces de execução, o framework exige que o agente infira comportamentos relevantes a partir de especificação de acesso a fontes. Estabelece avaliação para skills reusáveis que estendem agentes com workflows especializados, convenções de ferramentas e comportamentos de domínio em tempo de inferência. Abrir fonte
Apodex 1.1: Scaling Agentic Intelligence for Complex Work
arXiv · 2026-08-24 Apresenta scaling em duas dimensões para capacidade de trabalho verificável: Environment Scaling amplia diversidade e verificabilidade de ambientes de arquivos, busca e código executável, e Agentic Coordination Scaling treina agentes para manutenção de estado, recuperação de falhas e entrega auditável. Define working capability como progresso sustentado e verificável rumo a objetivos reais, além de raciocínio e síntese. Relevante para orquestração de modelos e infraestrutura de treino de agentes. Abrir fonte
How to Train a Critic Stably and Efficiently
arXiv · 2026-08-24 Aborda instabilidade do treino de critic em RL para LLMs e propõe Best-Practice Critic Optimization (BPCO). Combina DPPO, predições de valor limitadas ao intervalo de recompensa, alvos Monte Carlo, vantagens de política não normalizadas e estimativa de vantagem generalizada adaptativa ao comprimento. Como o critic só é usado no treino, pode ser condicionado a informações definidoras de recompensa como gabarito ou rubrica ocultas da política. Valida cada escolha em raciocínio matemático em múltiplas escalas. Abrir fonte
ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings
arXiv · 2026-08-24 Propõe LM baseado em flow no espaço de embeddings que restringe o preditor de dados ao fecho convexo dos embeddings de tokens e treina apenas com erro quadrático médio derivado de flow matching. Diferente de frameworks contínuos que ainda dependem de decoder com entropia cruzada, garante convergência provada das trajetórias para embeddings válidos. Avanço em arquitetura de modelos, tokenizers e representações esparsas para eficiência de memória. Abrir fonte
The Emergence of Relevance Through Axiomatic Attention Patterns During LoRA Fine-Tuning
arXiv · 2026-08-24 Investiga onde ganhos de reranking com LoRA emergem na rede RankLLaMA e se coincidem com padrões interpretáveis de relevância. Via ablações, mostra que, com MLPs ajustados por LoRA, restringir atualizações de atenção a camadas específicas preserva desempenho e revela emergência de matching lexical, sensibilidade à raridade e interação query-documento. Trabalho une fine-tuning eficiente e interpretabilidade de atenção. Abrir fonte
MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction
arXiv · 2026-08-24 Agente clínico que evolui conhecimento de processo governado sem fine-tuning do backbone. Separa experiência em quatro bancos tipados para skills clínicas, regras de processo, esquemas simbólicos e procedimentos de medição, com proveniência, suporte, replay e checagens de segurança antes de publicar snapshot congelado para teste. Demonstra evolução de skills sob restrições de evidência e observabilidade parcial, aplicável a orquestração de skills em domínios críticos. Abrir fonte
MetaCaster: Meta-Harness-Optimized Agent for End-to-End Few-Shot Learning of Lightweight Time Series Forecasters
arXiv · 2026-08-24 Framework multiagente meta-harness-optimized para few-shot learning de previsores leves em séries temporais. Em cenários com dados escassos e sensíveis à privacidade, usa agentes para otimizar todo o pipeline de treino de modelos compactos, evitando custo de foundation models. Relevante para harnesses, orquestração e infraestrutura de treino eficiente em contextos com recursos limitados. Abrir fonte
ProxyFormer: A Dual-Stream Proxy Architecture for Ultra-Long Context and High-Resolution Generation
arXiv · 2026-08-24 Arquitetura dual-stream que comprime features locais bottom-up em poucos tokens proxy, executa interações globais apenas no espaço comprimido e descomprime top-down para o stream local. Resolve crescimento quadrático de computação de atenção e cache KV com comprimento de sequência, viabilizando LLMs de contexto ultra-longo e geração de alta resolução. Avanço direto em inference e escalonamento de infraestrutura. Abrir fonte
Sigmoid Attention as a Better Substrate for Learned KV Cache Eviction
arXiv · 2026-08-24 Estudo controlado 2×2×2 sobre tipo de atenção, gating aprendido e codificação posicional em Transformers escala GPT-2 treinados no OpenWebText. Mostra que, embora atenção sigmoid seja pior como LM denso, ela supera softmax quando combinada com evicção hard aprendida de KV cache, mitigando o mismatch soft-to-hard entre treino com gates diferenciáveis e remoção física em inferência. Implicações para quantização implícita e otimização de memória em serving. Abrir fonte
EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards
arXiv · 2026-08-24 Benchmark com 405 tarefas reproduzíveis ancoradas em 199 eventos documentados e 19 famílias de hazards para avaliar agentes científicos. Exige inspeção de pacotes heterogêneos, escolha de evidências compatíveis, execução de cálculos transparentes e reconciliação de divergências entre fontes. Oferece harness de avaliação para agência científica de longo horizonte em sistemas terrestres dinâmicos. Abrir fonte
SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
arXiv · 2026-08-24 Benchmark de 20 migrações de stack em repositório inteiro para testar se coding agents realizam migrações além de correção de bugs. Introduz diagnóstico de Blindness, quando agentes copiam implementação original apenas para passar em testes comportamentais sem efetuar migração. Avalia migração efetiva versus correção superficial, com implicações para harnesses de avaliação de agentes de código de longo horizonte. Abrir fonte
Credal Large Language Models for Semantic Commitment under Uncertainty
arXiv · 2026-08-24 Introduz CLLMs onde ensemble de adapters LoRA induz conjunto credal cujas probabilidades inferior e superior expõem dispersão de distribuições preditivas em vez de colapsar em único softmax. Deriva escores de comprometimento para separar ignorância epistêmica de ambiguidade genuína e mitigar respostas fluentes mas superconfiantes. Contribuição em fine-tuning com LoRA, quantização de incerteza e interpretabilidade. Abrir fonte
Nota de cobertura: buscas nativas em 10 idiomas (pt, en, it, es, fr, de, ru, zh, ko, ja) em harnesses, skills, vLLM, llama.cpp, fine-tuning, quantização e inference não retornaram publicações não-arXiv com data verificável em 2026-08-24 — DDGS com timelimit=d retornou guias evergreen ou datas 2026-08-25/26. Hugging Face Blog, Unsloth/Gigazine e comparativos vLLM/SGLang verificados estavam fora da janela D. Das 100 entradas arXiv de cs.CL/cs.LG/cs.AI em D, 70 continham termos LLM; 13 acima foram curadas como representativas de harnesses, skills, agentes, fine-tuning, inference/tokenizers e interpretabilidade. Lacuna: releases de lm-eval-harness, vLLM e llama.cpp não publicaram versão datada em D.