<?xml version="1.0" encoding="utf-8"?><?xml-stylesheet type="text/xsl" href="atom.xsl"?>
<feed xmlns="http://www.w3.org/2005/Atom">
    <id>https://news.loldinis.com/ia</id>
    <title>Hub Blog</title>
    <updated>2026-08-25T00:00:00.000Z</updated>
    <generator>https://github.com/jpmonette/feed</generator>
    <link rel="alternate" href="https://news.loldinis.com/ia"/>
    <subtitle>Hub Blog</subtitle>
    <icon>https://news.loldinis.com/img/favicon.ico</icon>
    <entry>
        <title type="html"><![CDATA[IA — notícias de 2026-08-25]]></title>
        <id>https://news.loldinis.com/ia/ia-not-cias-de-2026-08-25</id>
        <link href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-25"/>
        <updated>2026-08-25T00:00:00.000Z</updated>
        <summary type="html"><![CDATA[9 fontes verificadas sobre harnesses, skills, agentes, fine-tuning, quantização, inference e arquitetura de LLMs em 2026-08-25.]]></summary>
        <content type="html"><![CDATA[<h2 class="anchor anchorTargetStickyNavbar_Vzrq" id="fontes">Fontes<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-25#fontes" class="hash-link" aria-label="Link direto para Fontes" title="Link direto para Fontes" translate="no">​</a></h2>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="granite-42-llms-how-theyre-built">Granite 4.2 LLMs: How They're Built<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-25#granite-42-llms-how-theyre-built" class="hash-link" aria-label="Link direto para Granite 4.2 LLMs: How They're Built" title="Link direto para Granite 4.2 LLMs: How They're Built" translate="no">​</a></h3>
<p>Hugging Face Blog · 2026-08-25
IBM detalha a família Granite 4.2, primeiros modelos densos decoder-only com raciocínio nativo em 3B, 8B e 30B parâmetros, treinados com RL agêntico para pensar e agir em ambientes. O post no Hugging Face Blog descreve escolhas de arquitetura, dados e treinamento que sustentam capacidades de reasoning e uso de ferramentas, com pesos abertos na plataforma. O lançamento posiciona a oferta enterprise da IBM com foco em eficiência e governança para casos de uso de negócio.
<a href="https://huggingface.co/blog/ibm-granite/granite-4-2" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="perplexitys-new-local-first-ai-runs-on-your-pc--and-asks-before-using-the-cloud">Perplexity's new local-first AI runs on your PC — and asks before using the cloud<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-25#perplexitys-new-local-first-ai-runs-on-your-pc--and-asks-before-using-the-cloud" class="hash-link" aria-label="Link direto para Perplexity's new local-first AI runs on your PC — and asks before using the cloud" title="Link direto para Perplexity's new local-first AI runs on your PC — and asks before using the cloud" translate="no">​</a></h3>
<p>Yahoo Tech · 2026-08-25
Perplexity apresentou o Portable Computer, agente de IA totalmente local que roda no NVIDIA DGX Spark e só aciona a nuvem com permissão explícita. A abordagem local-first busca reduzir latência, preservar privacidade e cortar custos de inferência ao manter contexto e execução no dispositivo. A cobertura contextualiza a parceria Perplexity–NVIDIA e o movimento por runtime local como alternativa a APIs hospedadas para agentes.
<a href="https://tech.yahoo.com/ai/perplexity-ai/articles/perplexity-local-first-ai-runs-133935341.html" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="recursive-experiential-working-memory-evolution-for-long-horizon-agent-harnesses-recuris">Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses (Recuris)<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-25#recursive-experiential-working-memory-evolution-for-long-horizon-agent-harnesses-recuris" class="hash-link" aria-label="Link direto para Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses (Recuris)" title="Link direto para Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses (Recuris)" translate="no">​</a></h3>
<p>arXiv · 2026-08-25
Propõe a arquitetura Recuris para harnesses de agentes de longo horizonte, onde Working Memory rastreia progresso da tarefa e guia seleção de skills a partir de Experiential Memory, alinhando invocação de skills ao estado atual. A evolução recursiva mitiga o problema de históricos crescentes que obscurecem o estado e desalinham o uso de skills. Contribuição direta para harnesses, orquestração de skills e melhoria recursiva de agentes.
<a href="https://arxiv.org/abs/2608.24876" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="starharness-evolving-harnesses-with-stratified-search-for-enterprise-environments">StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-25#starharness-evolving-harnesses-with-stratified-search-for-enterprise-environments" class="hash-link" aria-label="Link direto para StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments" title="Link direto para StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments" translate="no">​</a></h3>
<p>arXiv · 2026-08-25
Apresenta o StarHarness, framework que evolui harnesses específicos do ambiente mantendo pesos do modelo fixos, incluindo prompts, framing da tarefa, interfaces de ferramentas, skills, providers via MCP, estrutura de subagentes e configuração do loop do agente. Usa estratificação de tarefas por comportamento de falha do baseline para construir um pool compacto de evolução e busca eficiente. Relevante para skills, subagentes e orquestração de modelos em cenários enterprise.
<a href="https://arxiv.org/abs/2608.24804" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="simthesizer-an-agent-driven-simulation-framework-for-llm-serving-systems">Simthesizer: An Agent-Driven Simulation Framework for LLM Serving Systems<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-25#simthesizer-an-agent-driven-simulation-framework-for-llm-serving-systems" class="hash-link" aria-label="Link direto para Simthesizer: An Agent-Driven Simulation Framework for LLM Serving Systems" title="Link direto para Simthesizer: An Agent-Driven Simulation Framework for LLM Serving Systems" translate="no">​</a></h3>
<p>arXiv · 2026-08-25
O Simthesizer é um framework de simulação em nível de sistema orientado por agentes para explorar o design space de serving de LLMs, onde deploys reais são caros e evoluções como workflows agênticos e serving desagregado já não cabem em simuladores monolíticos. A proposta supera o gargalo de simuladores mantidos manualmente, que evoluem mais devagar que o próprio serving moderno. Avanço em infraestrutura de treino/serving, vLLM e otimização de throughput e custo de inferência.
<a href="https://arxiv.org/abs/2608.24650" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="quantization-effects-on-bangla-language-understanding-in-large-language-models-a-systematic-evaluation">Quantization Effects on Bangla Language Understanding in Large Language Models: A Systematic Evaluation<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-25#quantization-effects-on-bangla-language-understanding-in-large-language-models-a-systematic-evaluation" class="hash-link" aria-label="Link direto para Quantization Effects on Bangla Language Understanding in Large Language Models: A Systematic Evaluation" title="Link direto para Quantization Effects on Bangla Language Understanding in Large Language Models: A Systematic Evaluation" translate="no">​</a></h3>
<p>arXiv · 2026-08-25
Avaliação sistemática dos efeitos de quantização pós-treino sobre compreensão de Bangla em LLMs, língua morfologicamente complexa e de baixo recurso. Mostra que conclusões sobre degradação ou preservação de desempenho derivadas de benchmarks em inglês não se transferem automaticamente, exigindo avaliação multilíngue. Estudo conecta quantização, inferência on-device e tokenizers, com implicações para deployment eficiente fora do eixo inglês.
<a href="https://arxiv.org/abs/2608.24615" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="browserforge-scaling-web-episode-via-parallel-browser-sandboxes">BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-25#browserforge-scaling-web-episode-via-parallel-browser-sandboxes" class="hash-link" aria-label="Link direto para BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes" title="Link direto para BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes" translate="no">​</a></h3>
<p>arXiv · 2026-08-25
Aborda a escala de dados de trajetórias para web agents que atuam a partir de pixels renderizados, evitando fragilidade e custo de tokens de HTML/árvore de acessibilidade. Propõe geração em larga escala via sandboxes de browser paralelos para produzir episódios web de alta qualidade, já que datasets públicos contêm apenas poucos milhares de trajetórias em conjuntos de sites restritos. Relevante para harnesses de agentes web, infraestrutura de treino e coleta de dados de interação.
<a href="https://arxiv.org/abs/2608.24848" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="viscache-visual-kv-cache-pruning-for-efficient-vision-large-language-model-inference">VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-25#viscache-visual-kv-cache-pruning-for-efficient-vision-large-language-model-inference" class="hash-link" aria-label="Link direto para VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference" title="Link direto para VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference" translate="no">​</a></h3>
<p>arXiv · 2026-08-25
Propõe o VisCache, método de poda de KV cache visual para inferência eficiente de Vision LLMs, cujo contexto longo sofre com overhead de memória e computação dos caches visuais. Diferente de compressão uniforme por tokens e camadas, aplica poda seletiva para preservar informação e evitar degradação. Contribuição em otimização de inference, quantização implícita de memória e serving de modelos multimodais.
<a href="https://arxiv.org/abs/2608.24063" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="spo-stream-aligned-policy-optimization-for-asynchronous-agentic-rl">SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-25#spo-stream-aligned-policy-optimization-for-asynchronous-agentic-rl" class="hash-link" aria-label="Link direto para SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL" title="Link direto para SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL" translate="no">​</a></h3>
<p>arXiv · 2026-08-25
Estende o Single-stream Policy Optimization (SPO) para RL agêntico assíncrono, removendo a dependência de rollouts irmãos do mesmo prompt e usando estimativa persistente de valor por prompt. Mostra que centralização por trajetória anterior gera viés e propõe alinhamento por stream com perda de ator em média de tokens, melhorando estabilidade e eficiência em trajetórias longas e variáveis com uso de ferramentas. Relevante para fine-tuning via RL, orquestração de agentes e infraestrutura de treino.
<a href="https://arxiv.org/abs/2608.24870" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<p>Nota de cobertura: buscas nativas em 10 idiomas (pt, en, it, es, fr, de, ru, zh, ko, ja) sobre harnesses, skills/agentes, fine-tuning, quantização, inference, tokenizers, interpretabilidade, vLLM, llama.cpp e arquitetura de modelos foram executadas via DDGS em 2026-08-26. DDGS news/text com timelimit retornou majoritariamente guias evergreen, páginas de projeto e datas fora de D (2026-08-24/26); consultas em italiano, francês, alemão, russo e coreano não retornaram resultados datados em D. Hugging Face Blog e Yahoo Tech cobriram Granite 4.2 e Perplexity local-first; arXiv API filtrou 100+ submissões de cs.CL/cs.LG/cs.AI/cs.CV/cs.AR em D, das quais 9 acima foram curadas como representativas do escopo. Lacuna: releases datadas de lm-eval-harness, vLLM e llama.cpp não publicaram versão em D; Hugging Face Hack, investigação do Alabama e Z.ai foram descartados por escopo (cibersegurança/regulatório vs. engenharia de LLMs). Paper 2608.24004 (AgentSpec, 02:49Z) foi excluído por cair em 2026-08-24 em America/Sao_Paulo (antes de 03:00Z).</p>]]></content>
        <category label="ia" term="ia"/>
    </entry>
    <entry>
        <title type="html"><![CDATA[IA — notícias de 2026-08-24]]></title>
        <id>https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24</id>
        <link href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24"/>
        <updated>2026-08-24T00:00:00.000Z</updated>
        <summary type="html"><![CDATA[13 fontes verificadas sobre harnesses, skills, agentes, fine-tuning, inference e arquitetura de LLMs em 2026-08-24.]]></summary>
        <content type="html"><![CDATA[<h2 class="anchor anchorTargetStickyNavbar_Vzrq" id="fontes">Fontes<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#fontes" class="hash-link" aria-label="Link direto para Fontes" title="Link direto para Fontes" translate="no">​</a></h2>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="prime-agent-a-self-improving-rlm-harness">Prime Agent: A Self-Improving RLM Harness<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#prime-agent-a-self-improving-rlm-harness" class="hash-link" aria-label="Link direto para Prime Agent: A Self-Improving RLM Harness" title="Link direto para Prime Agent: A Self-Improving RLM Harness" translate="no">​</a></h3>
<p>arXiv · 2026-08-24
Harness open-source para avaliação de longo horizonte e workflows de coding agents. Propõe abstração Recursive Language Model com REPL IPython persistente para processamento programático de contexto e compute em tempo de teste, além de Continual Harness que preserva históricos, memórias, skills e especificações de subagentes entre trajetórias. Subagentes recursivos coordenam-se por comunicação direta agente-a-agente com visão unificada de execução.
<a href="https://arxiv.org/abs/2608.23552v1" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="skillalchemy-open-world-agent-skill-creation">SkillAlchemy: Open-World Agent Skill Creation<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#skillalchemy-open-world-agent-skill-creation" class="hash-link" aria-label="Link direto para SkillAlchemy: Open-World Agent Skill Creation" title="Link direto para SkillAlchemy: Open-World Agent Skill Creation" translate="no">​</a></h3>
<p>arXiv · 2026-08-24
Estuda criação de skills em mundo aberto, onde um criador deve descobrir requisitos omitidos pelo briefing a partir de materiais externos. Diferente de geração dependente de autoria humana ou traces de execução, o framework exige que o agente infira comportamentos relevantes a partir de especificação de acesso a fontes. Estabelece avaliação para skills reusáveis que estendem agentes com workflows especializados, convenções de ferramentas e comportamentos de domínio em tempo de inferência.
<a href="https://arxiv.org/abs/2608.23417v1" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="apodex-11-scaling-agentic-intelligence-for-complex-work">Apodex 1.1: Scaling Agentic Intelligence for Complex Work<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#apodex-11-scaling-agentic-intelligence-for-complex-work" class="hash-link" aria-label="Link direto para Apodex 1.1: Scaling Agentic Intelligence for Complex Work" title="Link direto para Apodex 1.1: Scaling Agentic Intelligence for Complex Work" translate="no">​</a></h3>
<p>arXiv · 2026-08-24
Apresenta scaling em duas dimensões para capacidade de trabalho verificável: Environment Scaling amplia diversidade e verificabilidade de ambientes de arquivos, busca e código executável, e Agentic Coordination Scaling treina agentes para manutenção de estado, recuperação de falhas e entrega auditável. Define working capability como progresso sustentado e verificável rumo a objetivos reais, além de raciocínio e síntese. Relevante para orquestração de modelos e infraestrutura de treino de agentes.
<a href="https://arxiv.org/abs/2608.23283v1" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="how-to-train-a-critic-stably-and-efficiently">How to Train a Critic Stably and Efficiently<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#how-to-train-a-critic-stably-and-efficiently" class="hash-link" aria-label="Link direto para How to Train a Critic Stably and Efficiently" title="Link direto para How to Train a Critic Stably and Efficiently" translate="no">​</a></h3>
<p>arXiv · 2026-08-24
Aborda instabilidade do treino de critic em RL para LLMs e propõe Best-Practice Critic Optimization (BPCO). Combina DPPO, predições de valor limitadas ao intervalo de recompensa, alvos Monte Carlo, vantagens de política não normalizadas e estimativa de vantagem generalizada adaptativa ao comprimento. Como o critic só é usado no treino, pode ser condicionado a informações definidoras de recompensa como gabarito ou rubrica ocultas da política. Valida cada escolha em raciocínio matemático em múltiplas escalas.
<a href="https://arxiv.org/abs/2608.23566v1" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="convergeflow-language-flow-with-provable-convergence-to-token-embeddings">ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#convergeflow-language-flow-with-provable-convergence-to-token-embeddings" class="hash-link" aria-label="Link direto para ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings" title="Link direto para ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings" translate="no">​</a></h3>
<p>arXiv · 2026-08-24
Propõe LM baseado em flow no espaço de embeddings que restringe o preditor de dados ao fecho convexo dos embeddings de tokens e treina apenas com erro quadrático médio derivado de flow matching. Diferente de frameworks contínuos que ainda dependem de decoder com entropia cruzada, garante convergência provada das trajetórias para embeddings válidos. Avanço em arquitetura de modelos, tokenizers e representações esparsas para eficiência de memória.
<a href="https://arxiv.org/abs/2608.23551v1" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="the-emergence-of-relevance-through-axiomatic-attention-patterns-during-lora-fine-tuning">The Emergence of Relevance Through Axiomatic Attention Patterns During LoRA Fine-Tuning<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#the-emergence-of-relevance-through-axiomatic-attention-patterns-during-lora-fine-tuning" class="hash-link" aria-label="Link direto para The Emergence of Relevance Through Axiomatic Attention Patterns During LoRA Fine-Tuning" title="Link direto para The Emergence of Relevance Through Axiomatic Attention Patterns During LoRA Fine-Tuning" translate="no">​</a></h3>
<p>arXiv · 2026-08-24
Investiga onde ganhos de reranking com LoRA emergem na rede RankLLaMA e se coincidem com padrões interpretáveis de relevância. Via ablações, mostra que, com MLPs ajustados por LoRA, restringir atualizações de atenção a camadas específicas preserva desempenho e revela emergência de matching lexical, sensibilidade à raridade e interação query-documento. Trabalho une fine-tuning eficiente e interpretabilidade de atenção.
<a href="https://arxiv.org/abs/2608.23338v1" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="mediskill-evo-process-constrained-self-evolution-for-evidence-grounded-clinical-interaction">MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#mediskill-evo-process-constrained-self-evolution-for-evidence-grounded-clinical-interaction" class="hash-link" aria-label="Link direto para MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction" title="Link direto para MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction" translate="no">​</a></h3>
<p>arXiv · 2026-08-24
Agente clínico que evolui conhecimento de processo governado sem fine-tuning do backbone. Separa experiência em quatro bancos tipados para skills clínicas, regras de processo, esquemas simbólicos e procedimentos de medição, com proveniência, suporte, replay e checagens de segurança antes de publicar snapshot congelado para teste. Demonstra evolução de skills sob restrições de evidência e observabilidade parcial, aplicável a orquestração de skills em domínios críticos.
<a href="https://arxiv.org/abs/2608.23397v1" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="metacaster-meta-harness-optimized-agent-for-end-to-end-few-shot-learning-of-lightweight-time-series-forecasters">MetaCaster: Meta-Harness-Optimized Agent for End-to-End Few-Shot Learning of Lightweight Time Series Forecasters<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#metacaster-meta-harness-optimized-agent-for-end-to-end-few-shot-learning-of-lightweight-time-series-forecasters" class="hash-link" aria-label="Link direto para MetaCaster: Meta-Harness-Optimized Agent for End-to-End Few-Shot Learning of Lightweight Time Series Forecasters" title="Link direto para MetaCaster: Meta-Harness-Optimized Agent for End-to-End Few-Shot Learning of Lightweight Time Series Forecasters" translate="no">​</a></h3>
<p>arXiv · 2026-08-24
Framework multiagente meta-harness-optimized para few-shot learning de previsores leves em séries temporais. Em cenários com dados escassos e sensíveis à privacidade, usa agentes para otimizar todo o pipeline de treino de modelos compactos, evitando custo de foundation models. Relevante para harnesses, orquestração e infraestrutura de treino eficiente em contextos com recursos limitados.
<a href="https://arxiv.org/abs/2608.23473v1" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="proxyformer-a-dual-stream-proxy-architecture-for-ultra-long-context-and-high-resolution-generation">ProxyFormer: A Dual-Stream Proxy Architecture for Ultra-Long Context and High-Resolution Generation<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#proxyformer-a-dual-stream-proxy-architecture-for-ultra-long-context-and-high-resolution-generation" class="hash-link" aria-label="Link direto para ProxyFormer: A Dual-Stream Proxy Architecture for Ultra-Long Context and High-Resolution Generation" title="Link direto para ProxyFormer: A Dual-Stream Proxy Architecture for Ultra-Long Context and High-Resolution Generation" translate="no">​</a></h3>
<p>arXiv · 2026-08-24
Arquitetura dual-stream que comprime features locais bottom-up em poucos tokens proxy, executa interações globais apenas no espaço comprimido e descomprime top-down para o stream local. Resolve crescimento quadrático de computação de atenção e cache KV com comprimento de sequência, viabilizando LLMs de contexto ultra-longo e geração de alta resolução. Avanço direto em inference e escalonamento de infraestrutura.
<a href="https://arxiv.org/abs/2608.23463v1" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="sigmoid-attention-as-a-better-substrate-for-learned-kv-cache-eviction">Sigmoid Attention as a Better Substrate for Learned KV Cache Eviction<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#sigmoid-attention-as-a-better-substrate-for-learned-kv-cache-eviction" class="hash-link" aria-label="Link direto para Sigmoid Attention as a Better Substrate for Learned KV Cache Eviction" title="Link direto para Sigmoid Attention as a Better Substrate for Learned KV Cache Eviction" translate="no">​</a></h3>
<p>arXiv · 2026-08-24
Estudo controlado 2×2×2 sobre tipo de atenção, gating aprendido e codificação posicional em Transformers escala GPT-2 treinados no OpenWebText. Mostra que, embora atenção sigmoid seja pior como LM denso, ela supera softmax quando combinada com evicção hard aprendida de KV cache, mitigando o mismatch soft-to-hard entre treino com gates diferenciáveis e remoção física em inferência. Implicações para quantização implícita e otimização de memória em serving.
<a href="https://arxiv.org/abs/2608.23296v1" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="earthverse-benchmarking-scientific-agents-across-dynamic-earth-systems-and-natural-hazards">EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#earthverse-benchmarking-scientific-agents-across-dynamic-earth-systems-and-natural-hazards" class="hash-link" aria-label="Link direto para EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards" title="Link direto para EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards" translate="no">​</a></h3>
<p>arXiv · 2026-08-24
Benchmark com 405 tarefas reproduzíveis ancoradas em 199 eventos documentados e 19 famílias de hazards para avaliar agentes científicos. Exige inspeção de pacotes heterogêneos, escolha de evidências compatíveis, execução de cálculos transparentes e reconciliação de divergências entre fontes. Oferece harness de avaliação para agência científica de longo horizonte em sistemas terrestres dinâmicos.
<a href="https://arxiv.org/abs/2608.23525v1" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="swe-refactor-bench-can-coding-agents-complete-a-long-horizon-whole-repository-stack-migration">SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#swe-refactor-bench-can-coding-agents-complete-a-long-horizon-whole-repository-stack-migration" class="hash-link" aria-label="Link direto para SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?" title="Link direto para SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?" translate="no">​</a></h3>
<p>arXiv · 2026-08-24
Benchmark de 20 migrações de stack em repositório inteiro para testar se coding agents realizam migrações além de correção de bugs. Introduz diagnóstico de Blindness, quando agentes copiam implementação original apenas para passar em testes comportamentais sem efetuar migração. Avalia migração efetiva versus correção superficial, com implicações para harnesses de avaliação de agentes de código de longo horizonte.
<a href="https://arxiv.org/abs/2608.23564v1" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<h3 class="anchor anchorTargetStickyNavbar_Vzrq" id="credal-large-language-models-for-semantic-commitment-under-uncertainty">Credal Large Language Models for Semantic Commitment under Uncertainty<a href="https://news.loldinis.com/ia/ia-not-cias-de-2026-08-24#credal-large-language-models-for-semantic-commitment-under-uncertainty" class="hash-link" aria-label="Link direto para Credal Large Language Models for Semantic Commitment under Uncertainty" title="Link direto para Credal Large Language Models for Semantic Commitment under Uncertainty" translate="no">​</a></h3>
<p>arXiv · 2026-08-24
Introduz CLLMs onde ensemble de adapters LoRA induz conjunto credal cujas probabilidades inferior e superior expõem dispersão de distribuições preditivas em vez de colapsar em único softmax. Deriva escores de comprometimento para separar ignorância epistêmica de ambiguidade genuína e mitigar respostas fluentes mas superconfiantes. Contribuição em fine-tuning com LoRA, quantização de incerteza e interpretabilidade.
<a href="https://arxiv.org/abs/2608.23244v1" target="_blank" rel="noopener noreferrer" class="">Abrir fonte</a></p>
<p>Nota de cobertura: buscas nativas em 10 idiomas (pt, en, it, es, fr, de, ru, zh, ko, ja) em harnesses, skills, vLLM, llama.cpp, fine-tuning, quantização e inference não retornaram publicações não-arXiv com data verificável em 2026-08-24 — DDGS com timelimit=d retornou guias evergreen ou datas 2026-08-25/26. Hugging Face Blog, Unsloth/Gigazine e comparativos vLLM/SGLang verificados estavam fora da janela D. Das 100 entradas arXiv de cs.CL/cs.LG/cs.AI em D, 70 continham termos LLM; 13 acima foram curadas como representativas de harnesses, skills, agentes, fine-tuning, inference/tokenizers e interpretabilidade. Lacuna: releases de lm-eval-harness, vLLM e llama.cpp não publicaram versão datada em D.</p>]]></content>
        <category label="ia" term="ia"/>
    </entry>
</feed>