"IA — notícias de 2026-08-30"
Fontes
llama.cpp b10689 — alloc dependencies em graph_optimize
GitHub ggml-org/llama.cpp · 2026-08-30
Permite passar dependências de alocação em ggml_graph_optimize, com novos testes de alocação para validar o caminho. Melhora o planejamento de memória de grafos de inference, evitando realocações e permitindo otimização mais agressiva de buffers em backends como CUDA e Metal. Relevante para serving GGUF quantizado com grafos otimizados.
llama.cpp b10690 — correção de Hadamard em context shift sem quantização
GitHub ggml-org/llama.cpp · 2026-08-30
Corrige cópia da matriz de Hadamard para o tensor k_rot apenas quando há buffer alocado, prevenindo crash durante context shift com K-cache não quantizado. Falha afetava rotação de chaves em contexto longo sem quantização de cache. Aumenta robustez de inference com janela estendida em CPU/Metal/CUDA.
llama.cpp b10691 — Metal corrige crash de pipeline nulo em mul_mat F16
GitHub ggml-org/llama.cpp · 2026-08-30
Corrige crash por pipeline nulo em mul_mat/mul_mat_id com src1 em F16 no backend Metal, falhando de forma fechada em shapes sem kernel F16 e abortando em pipeline nil no encoder. Evita falhas silenciosas e corrupção em inference quantizada mista em Apple Silicon. Complementa série de fixes Metal da janela.
llama.cpp b10692 — SYCL divide linhas longas em TOP_K
GitHub ggml-org/llama.cpp · 2026-08-30
Altera TOP_K no SYCL para dividir linhas longas em vez de um work-group por linha, paralelizando melhor logits de vocabulário grande. Reduz latência de sampling e melhora ocupação em Intel Arc/Battlemage via oneAPI. Útil para decode com top-k/top-p em modelos com vocabulário estendido.
llama.cpp b10693 — Hexagon: descoberta de dispositivo e sessões sob demanda
GitHub ggml-org/llama.cpp · 2026-08-30
Adiciona suporte a descoberta de dispositivos e criação de sessões sob demanda no backend Hexagon com alocação lazy e limpeza de interfaces. Viabiliza inference em DSPs Hexagon de Snapdragon com gerenciamento eficiente de sessões para MoE e modelos quantizados. Expande cobertura heterogênea para edge com NPU/DSP.
llama.cpp b10694 — RPC corrige compatibilidade com macOS pré-RDMA
GitHub ggml-org/llama.cpp · 2026-08-30
Corrige backend RPC para versões de macOS anteriores ao suporte RDMA, evitando falha de inicialização do transporte remoto. Garante offloading distribuído via RPC em Macs antigos sem RDMA. Relevante para clusters híbridos Apple Silicon com RPC.
llama.cpp b10695 — vendor atualiza cpp-httplib para 0.54.1
GitHub ggml-org/llama.cpp · 2026-08-30
Atualiza a dependência cpp-httplib para 0.54.0/0.54.1 no servidor HTTP OpenAI-compatível do llama.cpp. Traz correções de HTTP e segurança para o servidor de inference. Sem mudança de API, mas melhora estabilidade do serving via API compatível com vLLM/Ollama.
llama.cpp b10696 — Metal: tuning FA-vec para Apple M3 Pro
GitHub ggml-org/llama.cpp · 2026-08-30
Adiciona tabelas fa_vec tuned para Apple M3 Pro, no contexto do tracking #27668 de tuning FlashAttention vetorizado. Otimiza kernels de attention quantizada (f16/q8) em Metal, elevando tokens/s em Macs M3 Pro. Parte do esforço coordenado para cobertura Apple Silicon.
llama.cpp b10697 — Metal: tuning FA-vec para M3 Ultra
GitHub ggml-org/llama.cpp · 2026-08-30
Inclui tunings FA-vec para Apple M3 Ultra, estendendo o trabalho de tuning Metal para o topo da linha Apple Silicon. Melhora throughput de attention em modelos GGUF q4/q8 no M3 Ultra com parâmetros calibrados em hardware real. Relevante para inference local de alto desempenho em Mac Studio.
llama.cpp b10698 — RPC corrige spew de erro RDMA Apple no teardown
GitHub ggml-org/llama.cpp · 2026-08-30
Corrige emissão excessiva de erros RDMA da Apple durante teardown do backend RPC. Reduz ruído de logs e evita falsos alertas em encerramento de sessões distribuídas. Melhoria de observabilidade para deployments RPC em macOS.
llama.cpp b10699 — ggml: ggml_backend_op_alloc_size_may_expand para backends com memória extra
GitHub ggml-org/llama.cpp · 2026-08-30
Introduz ggml_backend_op_alloc_size_may_expand para backends que exigem memória adicional para dados efêmeros (Metal, SYCL, WebGPU) e usa no RPC. Reflete overhead de alocação que antes era subestimado, evitando OOM e corrupção em operações que expandem temporariamente. Crítico para inference quantizada em backends com staging extra.
llama.cpp b10700 — renomeia --tensor-read-lazy para --lazy-mode (-lzm)
GitHub ggml-org/llama.cpp · 2026-08-30
Renomeia o argumento CLI --tensor-read-lazy para --lazy-mode com atalho -lzm, alinhando com o parâmetro interno lazy_mode. Facilita uso de carregamento lazy de tensores para reduzir pico de RAM/VRAM ao carregar GGUF grandes. Mantém compatibilidade de plumbing interno e melhora ergonomia do harness.
llama.cpp b10701 — DFlash corrige escalas NVFP4 ausentes em attention
GitHub ggml-org/llama.cpp · 2026-08-30
Corrige passagem de escalas NVFP4 faltantes para operações de attention no caminho DFlash2, que fazia modelos draft NVFP4 quase não terem tokens aceitos em speculative decoding. Restaura taxa de aceitação de draft com quantização NVFP4, recuperando speedup de decoding especulativo para modelos quantizados de baixa precisão em Blackwell e similares.
llama.cpp b10702 — HIP otimiza caminho Q2_0 dot-product para gfx1201
GitHub ggml-org/llama.cpp · 2026-08-30
Otimiza o caminho vec_dot_q2_0_q8_1 para gfx1201 (RDNA4) com perm nativa amdgcn, ampliando otimização de perm Q2_0 no HIP. Acelera matmul quantizado Q2_0 em GPUs AMD RDNA4 via ROCm. Ganho direto para inference GGUF Q2_K/Q2_0 em Radeon RX de nova geração.
llama.cpp b10703 — HIP: tuning de config MMQ para RDNA3
GitHub ggml-org/llama.cpp · 2026-08-30
Ajusta configuração MMQ para RDNA3 no backend HIP, refinando tiling e paralelismo de matmul quantizado. Melhora throughput em GPUs AMD RDNA3 (7900 XT/XTX) para GGUF Q4/Q5. Parte do tuning contínuo de HIP para cobrir RDNA3 e RDNA4.
llama.cpp b10704 — CUDA usa caminho rápido mm_ids_helper para qualquer n_expert_used
GitHub ggml-org/llama.cpp · 2026-08-30
Generaliza o caminho rápido mm_ids_helper em CUDA para qualquer n_expert_used, antes restrito a warp_size % n_expert_used == 0. Remove hardcode e agrupa warp lanes por token para MoE, acelerando mul_mat_id em modelos mixture-of-experts. Beneficia inference de MoE esparsos como Qwen e DeepSeek em NVIDIA.
llama.cpp b10705 — melhora manuseio de TENSOR_READ_LAZY em llama
GitHub ggml-org/llama.cpp · 2026-08-30
Melhora o tratamento de TENSOR_READ_LAZY no núcleo llama, forçando tensor lazy em CPU quando lazy está ativo. Corrige interação entre carregamento lazy e placement de tensores, reduzindo cópias e pico de memória. Complementa a renomeação para --lazy-mode do b10700.
llama.cpp b10706 — ggml adiciona SWIGLU_CLAMP
GitHub ggml-org/llama.cpp · 2026-08-30
Adiciona operação SWIGLU_CLAMP em ggml com shader Vulkan correspondente, suportando variante clamped de SwiGLU usada em arquiteturas recentes. Habilita execução correta de FFNs com clamp em backends GGML/Vulkan. Prepara suporte a modelos que usam ativação SwiGLU com limite.
Nota de cobertura: varredura em 10 idiomas (pt, en, it, es, fr, de, ru, zh, ko, ja) com consultas nativas para harnesses, skills, agentes, lm-eval, vLLM, llama.cpp, fine-tuning, quantização, inference e tokenizers. Verificação via arXiv API (cs.CL/cs.LG/cs.AI/cs.NE/cs.SE/stat.ML) não retornou papers com published ou updated em D — 2026-08-30 foi domingo, sem anúncio arXiv (padrão de não-publicação de fim de semana; janela BRT [2026-08-30 03:00 UTC, 2026-08-31 03:00 UTC) vazia). GitHub Releases API para vLLM (último v0.28.0 em 2026-08-26T09:46:30Z), transformers, peft, tokenizers, ollama, DeepSpeed, diffusers, unsloth, axolotl e trl não apresentou tags com published_at em D; apenas ggml-org/llama.cpp publicou tags em D (18 releases b10689–b10706, todas preservadas acima, verificadas via api.github.com). Hugging Face Hub (api/models) e buscas web com recorte temporal não retornaram modelo trending com lastModified em D dentro do escopo LLM inference/quantização; artigos secundários sobre vLLM 0.28.0 e Hy4 datam de 2026-08-26/29 fora da janela. Softwares genéricos com IA integrada foram excluídos. Lacuna: nenhum paper arXiv novo, nenhum release de lm-eval-harness/SGLang/vLLM e nenhum modelo relevante no Hub com data verificável em 2026-08-30 além dos 18 de llama.cpp.