Pular para o conteúdo principal

IA — notícias de 2026-08-24

· 6 min para ler

Fontes

Prime Agent: A Self-Improving RLM Harness

arXiv · 2026-08-24 Harness open-source para avaliação de longo horizonte e workflows de coding agents. Propõe abstração Recursive Language Model com REPL IPython persistente para processamento programático de contexto e compute em tempo de teste, além de Continual Harness que preserva históricos, memórias, skills e especificações de subagentes entre trajetórias. Subagentes recursivos coordenam-se por comunicação direta agente-a-agente com visão unificada de execução. Abrir fonte

SkillAlchemy: Open-World Agent Skill Creation

arXiv · 2026-08-24 Estuda criação de skills em mundo aberto, onde um criador deve descobrir requisitos omitidos pelo briefing a partir de materiais externos. Diferente de geração dependente de autoria humana ou traces de execução, o framework exige que o agente infira comportamentos relevantes a partir de especificação de acesso a fontes. Estabelece avaliação para skills reusáveis que estendem agentes com workflows especializados, convenções de ferramentas e comportamentos de domínio em tempo de inferência. Abrir fonte

Apodex 1.1: Scaling Agentic Intelligence for Complex Work

arXiv · 2026-08-24 Apresenta scaling em duas dimensões para capacidade de trabalho verificável: Environment Scaling amplia diversidade e verificabilidade de ambientes de arquivos, busca e código executável, e Agentic Coordination Scaling treina agentes para manutenção de estado, recuperação de falhas e entrega auditável. Define working capability como progresso sustentado e verificável rumo a objetivos reais, além de raciocínio e síntese. Relevante para orquestração de modelos e infraestrutura de treino de agentes. Abrir fonte

How to Train a Critic Stably and Efficiently

arXiv · 2026-08-24 Aborda instabilidade do treino de critic em RL para LLMs e propõe Best-Practice Critic Optimization (BPCO). Combina DPPO, predições de valor limitadas ao intervalo de recompensa, alvos Monte Carlo, vantagens de política não normalizadas e estimativa de vantagem generalizada adaptativa ao comprimento. Como o critic só é usado no treino, pode ser condicionado a informações definidoras de recompensa como gabarito ou rubrica ocultas da política. Valida cada escolha em raciocínio matemático em múltiplas escalas. Abrir fonte

ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings

arXiv · 2026-08-24 Propõe LM baseado em flow no espaço de embeddings que restringe o preditor de dados ao fecho convexo dos embeddings de tokens e treina apenas com erro quadrático médio derivado de flow matching. Diferente de frameworks contínuos que ainda dependem de decoder com entropia cruzada, garante convergência provada das trajetórias para embeddings válidos. Avanço em arquitetura de modelos, tokenizers e representações esparsas para eficiência de memória. Abrir fonte

The Emergence of Relevance Through Axiomatic Attention Patterns During LoRA Fine-Tuning

arXiv · 2026-08-24 Investiga onde ganhos de reranking com LoRA emergem na rede RankLLaMA e se coincidem com padrões interpretáveis de relevância. Via ablações, mostra que, com MLPs ajustados por LoRA, restringir atualizações de atenção a camadas específicas preserva desempenho e revela emergência de matching lexical, sensibilidade à raridade e interação query-documento. Trabalho une fine-tuning eficiente e interpretabilidade de atenção. Abrir fonte

MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction

arXiv · 2026-08-24 Agente clínico que evolui conhecimento de processo governado sem fine-tuning do backbone. Separa experiência em quatro bancos tipados para skills clínicas, regras de processo, esquemas simbólicos e procedimentos de medição, com proveniência, suporte, replay e checagens de segurança antes de publicar snapshot congelado para teste. Demonstra evolução de skills sob restrições de evidência e observabilidade parcial, aplicável a orquestração de skills em domínios críticos. Abrir fonte

MetaCaster: Meta-Harness-Optimized Agent for End-to-End Few-Shot Learning of Lightweight Time Series Forecasters

arXiv · 2026-08-24 Framework multiagente meta-harness-optimized para few-shot learning de previsores leves em séries temporais. Em cenários com dados escassos e sensíveis à privacidade, usa agentes para otimizar todo o pipeline de treino de modelos compactos, evitando custo de foundation models. Relevante para harnesses, orquestração e infraestrutura de treino eficiente em contextos com recursos limitados. Abrir fonte

ProxyFormer: A Dual-Stream Proxy Architecture for Ultra-Long Context and High-Resolution Generation

arXiv · 2026-08-24 Arquitetura dual-stream que comprime features locais bottom-up em poucos tokens proxy, executa interações globais apenas no espaço comprimido e descomprime top-down para o stream local. Resolve crescimento quadrático de computação de atenção e cache KV com comprimento de sequência, viabilizando LLMs de contexto ultra-longo e geração de alta resolução. Avanço direto em inference e escalonamento de infraestrutura. Abrir fonte

Sigmoid Attention as a Better Substrate for Learned KV Cache Eviction

arXiv · 2026-08-24 Estudo controlado 2×2×2 sobre tipo de atenção, gating aprendido e codificação posicional em Transformers escala GPT-2 treinados no OpenWebText. Mostra que, embora atenção sigmoid seja pior como LM denso, ela supera softmax quando combinada com evicção hard aprendida de KV cache, mitigando o mismatch soft-to-hard entre treino com gates diferenciáveis e remoção física em inferência. Implicações para quantização implícita e otimização de memória em serving. Abrir fonte

EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards

arXiv · 2026-08-24 Benchmark com 405 tarefas reproduzíveis ancoradas em 199 eventos documentados e 19 famílias de hazards para avaliar agentes científicos. Exige inspeção de pacotes heterogêneos, escolha de evidências compatíveis, execução de cálculos transparentes e reconciliação de divergências entre fontes. Oferece harness de avaliação para agência científica de longo horizonte em sistemas terrestres dinâmicos. Abrir fonte

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

arXiv · 2026-08-24 Benchmark de 20 migrações de stack em repositório inteiro para testar se coding agents realizam migrações além de correção de bugs. Introduz diagnóstico de Blindness, quando agentes copiam implementação original apenas para passar em testes comportamentais sem efetuar migração. Avalia migração efetiva versus correção superficial, com implicações para harnesses de avaliação de agentes de código de longo horizonte. Abrir fonte

Credal Large Language Models for Semantic Commitment under Uncertainty

arXiv · 2026-08-24 Introduz CLLMs onde ensemble de adapters LoRA induz conjunto credal cujas probabilidades inferior e superior expõem dispersão de distribuições preditivas em vez de colapsar em único softmax. Deriva escores de comprometimento para separar ignorância epistêmica de ambiguidade genuína e mitigar respostas fluentes mas superconfiantes. Contribuição em fine-tuning com LoRA, quantização de incerteza e interpretabilidade. Abrir fonte

Nota de cobertura: buscas nativas em 10 idiomas (pt, en, it, es, fr, de, ru, zh, ko, ja) em harnesses, skills, vLLM, llama.cpp, fine-tuning, quantização e inference não retornaram publicações não-arXiv com data verificável em 2026-08-24 — DDGS com timelimit=d retornou guias evergreen ou datas 2026-08-25/26. Hugging Face Blog, Unsloth/Gigazine e comparativos vLLM/SGLang verificados estavam fora da janela D. Das 100 entradas arXiv de cs.CL/cs.LG/cs.AI em D, 70 continham termos LLM; 13 acima foram curadas como representativas de harnesses, skills, agentes, fine-tuning, inference/tokenizers e interpretabilidade. Lacuna: releases de lm-eval-harness, vLLM e llama.cpp não publicaram versão datada em D.