IA — notícias de 2026-08-25
Fontes
Granite 4.2 LLMs: How They're Built
Hugging Face Blog · 2026-08-25 IBM detalha a família Granite 4.2, primeiros modelos densos decoder-only com raciocínio nativo em 3B, 8B e 30B parâmetros, treinados com RL agêntico para pensar e agir em ambientes. O post no Hugging Face Blog descreve escolhas de arquitetura, dados e treinamento que sustentam capacidades de reasoning e uso de ferramentas, com pesos abertos na plataforma. O lançamento posiciona a oferta enterprise da IBM com foco em eficiência e governança para casos de uso de negócio. Abrir fonte
Perplexity's new local-first AI runs on your PC — and asks before using the cloud
Yahoo Tech · 2026-08-25 Perplexity apresentou o Portable Computer, agente de IA totalmente local que roda no NVIDIA DGX Spark e só aciona a nuvem com permissão explícita. A abordagem local-first busca reduzir latência, preservar privacidade e cortar custos de inferência ao manter contexto e execução no dispositivo. A cobertura contextualiza a parceria Perplexity–NVIDIA e o movimento por runtime local como alternativa a APIs hospedadas para agentes. Abrir fonte
Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses (Recuris)
arXiv · 2026-08-25 Propõe a arquitetura Recuris para harnesses de agentes de longo horizonte, onde Working Memory rastreia progresso da tarefa e guia seleção de skills a partir de Experiential Memory, alinhando invocação de skills ao estado atual. A evolução recursiva mitiga o problema de históricos crescentes que obscurecem o estado e desalinham o uso de skills. Contribuição direta para harnesses, orquestração de skills e melhoria recursiva de agentes. Abrir fonte
StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
arXiv · 2026-08-25 Apresenta o StarHarness, framework que evolui harnesses específicos do ambiente mantendo pesos do modelo fixos, incluindo prompts, framing da tarefa, interfaces de ferramentas, skills, providers via MCP, estrutura de subagentes e configuração do loop do agente. Usa estratificação de tarefas por comportamento de falha do baseline para construir um pool compacto de evolução e busca eficiente. Relevante para skills, subagentes e orquestração de modelos em cenários enterprise. Abrir fonte
Simthesizer: An Agent-Driven Simulation Framework for LLM Serving Systems
arXiv · 2026-08-25 O Simthesizer é um framework de simulação em nível de sistema orientado por agentes para explorar o design space de serving de LLMs, onde deploys reais são caros e evoluções como workflows agênticos e serving desagregado já não cabem em simuladores monolíticos. A proposta supera o gargalo de simuladores mantidos manualmente, que evoluem mais devagar que o próprio serving moderno. Avanço em infraestrutura de treino/serving, vLLM e otimização de throughput e custo de inferência. Abrir fonte
Quantization Effects on Bangla Language Understanding in Large Language Models: A Systematic Evaluation
arXiv · 2026-08-25 Avaliação sistemática dos efeitos de quantização pós-treino sobre compreensão de Bangla em LLMs, língua morfologicamente complexa e de baixo recurso. Mostra que conclusões sobre degradação ou preservação de desempenho derivadas de benchmarks em inglês não se transferem automaticamente, exigindo avaliação multilíngue. Estudo conecta quantização, inferência on-device e tokenizers, com implicações para deployment eficiente fora do eixo inglês. Abrir fonte
BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes
arXiv · 2026-08-25 Aborda a escala de dados de trajetórias para web agents que atuam a partir de pixels renderizados, evitando fragilidade e custo de tokens de HTML/árvore de acessibilidade. Propõe geração em larga escala via sandboxes de browser paralelos para produzir episódios web de alta qualidade, já que datasets públicos contêm apenas poucos milhares de trajetórias em conjuntos de sites restritos. Relevante para harnesses de agentes web, infraestrutura de treino e coleta de dados de interação. Abrir fonte
VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference
arXiv · 2026-08-25 Propõe o VisCache, método de poda de KV cache visual para inferência eficiente de Vision LLMs, cujo contexto longo sofre com overhead de memória e computação dos caches visuais. Diferente de compressão uniforme por tokens e camadas, aplica poda seletiva para preservar informação e evitar degradação. Contribuição em otimização de inference, quantização implícita de memória e serving de modelos multimodais. Abrir fonte
SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL
arXiv · 2026-08-25 Estende o Single-stream Policy Optimization (SPO) para RL agêntico assíncrono, removendo a dependência de rollouts irmãos do mesmo prompt e usando estimativa persistente de valor por prompt. Mostra que centralização por trajetória anterior gera viés e propõe alinhamento por stream com perda de ator em média de tokens, melhorando estabilidade e eficiência em trajetórias longas e variáveis com uso de ferramentas. Relevante para fine-tuning via RL, orquestração de agentes e infraestrutura de treino. Abrir fonte
Nota de cobertura: buscas nativas em 10 idiomas (pt, en, it, es, fr, de, ru, zh, ko, ja) sobre harnesses, skills/agentes, fine-tuning, quantização, inference, tokenizers, interpretabilidade, vLLM, llama.cpp e arquitetura de modelos foram executadas via DDGS em 2026-08-26. DDGS news/text com timelimit retornou majoritariamente guias evergreen, páginas de projeto e datas fora de D (2026-08-24/26); consultas em italiano, francês, alemão, russo e coreano não retornaram resultados datados em D. Hugging Face Blog e Yahoo Tech cobriram Granite 4.2 e Perplexity local-first; arXiv API filtrou 100+ submissões de cs.CL/cs.LG/cs.AI/cs.CV/cs.AR em D, das quais 9 acima foram curadas como representativas do escopo. Lacuna: releases datadas de lm-eval-harness, vLLM e llama.cpp não publicaram versão em D; Hugging Face Hack, investigação do Alabama e Z.ai foram descartados por escopo (cibersegurança/regulatório vs. engenharia de LLMs). Paper 2608.24004 (AgentSpec, 02:49Z) foi excluído por cair em 2026-08-24 em America/Sao_Paulo (antes de 03:00Z).