Pular para o conteúdo principal

"IA — notícias de 2026-08-27"

· 9 min para ler

Fontes

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

arXiv cs.AI/cs.CL — 2026-08-27

Agentes que descobrem skills automaticamente deixam insights espalhados no histórico. O WikiSkill co-evolui skills com uma wiki persistente, separando experiência bruta de conhecimento acumulado e permitindo reuso sistemático entre iterações. Em cenários multi-tarefa, o framework reduz redundância de descoberta, acelera adaptação e melhora transferência de skills entre agentes.

Abrir fonte

CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes

arXiv cs.CL — 2026-08-27

Métodos de scaling em tempo de inferência dependem de geração repetida ou verificação externa. O CritICL observa que modos de falha de LLMs formam padrões estruturados entre escalas da mesma família e os usa como guia. Em vez de descartar erros, o método extrai falhas de um modelo pequeno para orientar o modelo grande na inferência, melhorando raciocínio com alta eficiência e sem re-treinamento.

Abrir fonte

TTPO: Test-Time Policy Optimization

arXiv cs.CL — 2026-08-27

RL e auto-distilação on-policy impulsionaram raciocínio matemático em LLMs, mas exigem labels de verdade, impedindo treino em tempo de teste. Substituir por pseudo-labels de voto majoritário é frágil quando o voto está errado. O TTPO observa assimetria: rollouts que discordam do pseudo-label tendem a estar errados mesmo quando o voto falha, propondo otimização de política em test-time robusta a esse ruído.

Abrir fonte

Cascaded Batch Prompting: inferência em lote sem perda de qualidade

arXiv cs.CL — 2026-08-27

Batch prompting acelera inferência ao processar múltiplas instâncias simultaneamente, mas degrada performance de forma imprevisível. O trabalho propõe cascaded batch prompting em duas etapas que desacopla raciocínio complexo de grounding simbólico. Experimentos em QA de múltipla escolha e NLI mostram que o método supera o baseline single-prompt e alcança speedup proporcional ao tamanho do lote.

Abrir fonte

FOCUS & RePAIR: mitigando degeneração de texto em LLMs podados

arXiv cs.CL/cs.AI/cs.LG — 2026-08-27

Poda comprime LLMs, mas amplifica degeneração como loops de repetição mesmo quando perplexidade permanece estável. O estudo decompõe a falha em risco de entrada no loop e persistência, mostrando que a persistência depende da massa de escape atribuída a alternativas plausíveis. FOCUS e RePAIR oferecem guia token-a-token que preserva diversidade de decodificação sem re-treino e reduz repetição em modelos podados.

Abrir fonte

Meta-Learning Where to Allocate Experts: compressão layer-wise condicionada à tarefa para MoEs

arXiv cs.CL — 2026-08-27

MoEs roteiam tokens para subconjuntos de experts, mas o número de experts ativos costuma ser fixo por camada e por tarefa, ignorando variação de redundância com profundidade. Offline aloca camada-a-camada e métodos token-level não consideram contexto da tarefa. O MetaNet meta-aprende, a partir do support set, onde alocar experts por camada condicionado à tarefa, comprimindo MoEs de forma adaptativa e melhorando tradeoff capacidade-compute.

Abrir fonte

Information-Guided Frontier Decoding: comprometimento guiado por utilidade contextual em dMLLMs

arXiv cs.CL — 2026-08-27

Em diffusion multimodal LLMs, a ordem em que tokens mascarados são comprometidos determina qualidade de decodificação. Estratégias baseadas em confiança priorizam tokens localmente fáceis, como pontuação, antes de âncoras semânticas, enfraquecendo propagação de contexto. O IGFD ranqueia candidatos por confiança, incerteza de vizinhança e utilidade contextual, melhorando fidelidade sem treino adicional.

Abrir fonte

Performance Foundations of Parallel & Distributed Reasoning Language Models

arXiv cs.LG/cs.AI — 2026-08-27

RL com recompensas verificáveis (RLVR) criou Reasoning LMs como DeepSeek-R1 e o3, mas o custo computacional — milhões de GPU-horas e pipelines multi-modelo fortemente acoplados — carece de fundamentos de performance. O paper estabelece bases de performance para RLMs paralelos e distribuídos, caracterizando gargalos de comunicação, memória e paralelismo, oferecendo modelo analítico para escalar raciocínio longo em larga escala.

Abrir fonte

RedEvoAgent: agente de red-teaming automático com evolução de skills guiada por experiência

arXiv cs.CR/cs.AI — 2026-08-27

Agentes LLM já operam em harnesses de nível produto onde jailbreaks causam uso perigoso de tools e mutações persistentes de estado, risco maior que texto inseguro. Métodos atuais usam ataques fixos ou retrieval de trajetórias completas com viés e alto overhead. O RedEvoAgent co-evolui skills de ataque e memória estruturada, corrigindo viés de retrieval e selecionando skills relevantes com interpretação explícita, elevando taxa de jailbreak em harness realista.

Abrir fonte

Persona-Execution Separation: padrão arquitetural para agentes LLM auditáveis

arXiv cs.SE/cs.AI — 2026-08-27

Em organizações governadas, a persona do agente (instruções, tom, auto-apresentação) precisa evoluir livremente, mas a execução (trabalho com estado e auditoria) deve ser rastreável. Um único domínio de confiança não resolve ambos de forma barata. O PES separa persona e execução em domínios distintos conectados por uma ponte contratual governada, mantendo execução sem rosto e auditada com DLP graduado.

Abrir fonte

When Context Gets Root: Privilege Escalation in LLM Harnesses

arXiv cs.CR/cs.SE — 2026-08-27

Harnesses que orquestram LLMs com tools frequentemente tratam contexto como dados inertes, mas saídas de tools e documentos podem carregar instruções que escalam privilégio. O estudo formaliza escalada de privilégio via contexto, mostrando como conteúdo injetado herda permissões do harness e propõe controles de separação e sanitização para evitar que contexto se torne root executivo do agente.

Abrir fonte

A Layer Importance Metric for Quantization Accounting for the Speed-Quality Trade-off

arXiv cs.LG — 2026-08-27

Quantização camada-a-camada exige decidir quais camadas toleram baixa precisão sem sacrificar qualidade nem velocidade. Métricas atuais focam apenas em erro de quantização, ignorando impacto em throughput. O paper propõe métrica de importância de camada que balanceia degradação de qualidade e ganho de velocidade, orientando alocação de bits mistos para compressão com tradeoff speed-quality explícito.

Abrir fonte

Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavioral Verification

arXiv cs.AI — 2026-08-27

Evoluir harnesses de agentes por tentativa e erro é caro quando cada candidato exige execução completa de workflow. O trabalho propõe verificação comportamental eficiente que poda candidatos de harness via verificação parcial de comportamento antes de rollout total, acelerando evolução de harness com menor custo de avaliação e mantendo fidelidade de seleção.

Abrir fonte

One Model, Many Minds: Unlocking Multi-Agent Synergy in a Single Agent via Self-Play

arXiv cs.MA — 2026-08-27

Sinergia multi-agente tipicamente exige múltiplos modelos ou coordenação externa, aumentando custo e complexidade. O paper mostra como um único modelo pode emular múltiplas mentes via self-play estruturado, destravando ganhos de colaboração, debate e verificação interna sem orquestração multi-modelo, com implicações para harness leve e escalável.

Abrir fonte

Boosting LLM Exploration via Weak-Model Guidance in RLVR

arXiv cs.CL — 2026-08-27

RL com recompensas verificáveis sofre com exploração limitada quando o modelo forte converge cedo para trajetórias de alta recompensa. O estudo guia exploração com um modelo fraco que propõe direções diversas, injetando ruído controlado durante RLVR para expandir cobertura de raciocínio e evitar colapso de modo, melhorando performance em matemática e código.

Abrir fonte

TwinKV: A Composable Repair Pass for KV Cache Eviction via Pairwise Key Redundancy

arXiv cs.CL — 2026-08-27

Evicção de KV cache é chave para contexto longo eficiente, mas estratégias agressivas descartam informação crítica e degradam qualidade. O TwinKV observa redundância pairwise entre chaves e propõe um passe de reparo componível que reconstrói pares evictados a partir de chaves retidas, permitindo compressão mais agressiva de KV cache sem perda significativa para inferência de long-context em larga escala.

Abrir fonte

llama.cpp b10665 — suporte DSpark para Nemotron3.5

GitHub ggml-org/llama.cpp — 2026-08-27

Release b10665 adiciona suporte ao modelo DSpark para a família Nemotron3.5, incluindo atualização do conversor dflash.cpp para arquitetura de atenção diferenciada. Co-autoria com Hugging Face, o PR #27804 amplia cobertura de arquiteturas suportadas em GGUF e mantém compatibilidade de inferência local via llama.cpp sem necessidade de backend cloud.

Abrir fonte

llama.cpp b10664 — operações HTP aceleradas por HVX (ABS e LOG) para Hexagon

GitHub ggml-org/llama.cpp — 2026-08-27

O b10664 registra operações HTP_OP_UNARY_ABS e HTP_OP_UNARY_LOG no ggml-hexagon e implementa hvx_abs_f32_aa e hvx_log_f32_aa acelerados por HVX para o backend Hexagon. Ganha-se eficiência em operações unárias em SoCs Snapdragon com DSP Hexagon, relevante para inferência on-device quantizada e baixa potência.

Abrir fonte

llama.cpp b10660 — GGUF para Qwen3.8-Flash-Next (qwen4exp)

GitHub ggml-org/llama.cpp — 2026-08-27

O b10660 introduz plumbing GGUF para HF model_type qwen4_exp (Qwen3.8-Flash-Next), com MODEL_ARCH.QWEN4EXP, tensores hc_* para variante hyper-connection de baixo rank e embeddings hash n-gram PLE. Difere dos tensores hc_* de DeepSeek-V4 e prepara llama.cpp para servir a nova geração Qwen com conexões hyper e routing eficiente em inferência local.

Abrir fonte

llama.cpp b10662 — ctx-per-slot (--kv-unified-per-slot) para KV cache unificado

GitHub ggml-org/llama.cpp — 2026-08-27

O servidor do llama.cpp ganha flag --kv-unified-per-slot que substitui frações de contexto por slots de pool de contexto. O PR #24124 refatora gerenciamento de KV unificado por slot, simplificando alocação, isolamento entre slots concorrentes e throughput em serving contínuo com batching, útil para multi-tenant inference e agentes paralelos.

Abrir fonte

Nota de cobertura: buscas nativas nos 10 idiomas (pt, en, it, es, fr, de, ru, zh, ko, ja) com foco em harness/skills/modelos LLM, inference, quantização, fine-tuning e arquitetura (lm-eval-harness, vLLM, llama.cpp, agentes, quantização, tokenizers). Foram varridos releases de llama.cpp (18 releases em D, selecionados 4 representativos de arquitetura/inference), vLLM e lm-evaluation-harness (sem release em D), arXiv cs.* (230 papers em D, filtrados para engenharia de modelos/harness) e Hugging Face trending (nenhum modelo GGUF/text-generation com lastModified em D dentre top verificados). Softwares genéricos com IA integrada foram excluídos. Lacuna: nenhum release Hugging Face verificado em D e nenhum paper em chinês/coreano/japonês com data em D além dos arXiv em inglês.