"IA — notícias de 2026-08-28"
Fontes
llama.cpp b10679 — bench com modo lazy para leitura de tensores
GitHub ggml-org/llama.cpp — 2026-08-28
O release b10679 adiciona a flag --tensor-read-lazy ao bench, permitindo medir leitura preguiçosa de tensores sem materialização completa em memória. A mudança renomeia variáveis para LLAMA_LAZY_MODE_* e afeta benchmarks de throughput e latência de carregamento de modelos GGUF grandes. Relevante para avaliação reproduzível de estratégias de paging e cache em inference local com vLLM/llama.cpp.
llama.cpp b10678 — qwen4exp com menos graph splits
GitHub ggml-org/llama.cpp — 2026-08-28
O b10678 reduz o número de splits de grafo para a arquitetura qwen4exp (Qwen3.8-Flash-Next com hyper-connections de baixo rank e PLE). Menos splits simplificam o grafo de computação, melhoram localidade de cache e reduzem overhead de scheduling em GPUs e Apple Silicon. Complementa o plumbing GGUF do b10660 e prepara inferência eficiente para a família Qwen-Next.
llama.cpp b10677 — correção crítica de aliasing de views no backend Vulkan
GitHub ggml-org/llama.cpp — 2026-08-28
Correção em ggml_vk_graph_optimize que tratava duas views do mesmo tensor como independentes, permitindo reordenação incorreta de nós. O bug gerava tokens silenciosamente errados sob greedy decoding, saídas não-determinísticas e aceitação inválida em speculative decoding, afetando modelos com estado recorrente como Qwen3.8 em Vulkan (AMD/NVIDIA). O fix compara view_src bases e exclui ops no-op (RESHAPE, VIEW, PERMUTE) de dependências de aliasing.
llama.cpp b10676 — correção de conv_transpose_2d para múltiplos batches
GitHub ggml-org/llama.cpp — 2026-08-28
O b10676 corrige ggml e backend Metal para que conv_transpose_2d compute todos os batches (ne[3]), não apenas o primeiro, que antes ficava zerado. A implementação agora itera sobre a dimensão de batch tanto na permutação de src1 quanto no loop principal e dimensiona o buffer de trabalho em ggml_graph_plan. Inclui teste multi-batch em test-backend-ops. Impacta modelos de visão e difusão que usam deconvolução em batch.
llama.cpp b10675 — Vulkan: hoisting de row IDs e contagem de experts para MoE
GitHub ggml-org/llama.cpp — 2026-08-28
Adiciona suporte a hoisting de row IDs e expert count nos shaders Vulkan, com otimizações em coopmat2 e count_experts (fastdiv, subgroupExclusiveAdd e push constants dedicadas). Melhora throughput de MoE (mixture-of-experts) ao computar offsets por expert com paralelismo eficiente e reduzir divergência em dispositivos que suportam subgrupos. Relevante para inference de modelos sparse em GPUs Vulkan com alta cardinalidade de experts.
llama.cpp b10673 — tunings FA-vec para Apple M4
GitHub ggml-org/llama.cpp — 2026-08-28
Inclui tabelas fa_vec_tuned para Apple M4 (10 GPU cores) cobrindo F16, Q4_0, Q4_1, Q5_0, Q5_1 e Q8_0 no ggml-metal-tuning.cpp. Os tunings otimizam FlashAttention vetorizado quantizado para Metal, aumentando tokens/s e eficiência energética em MacBooks com M4. Contribuição da comunidade validada via ggml-metal-tuning fa-vec com sweep reproduzível.
llama.cpp b10672 — OpenVINO 2026.3.1, suporte Whisper.cpp e Qwen3.5 em NPU
GitHub ggml-org/llama.cpp — 2026-08-28
Atualiza o backend OpenVINO para 2026.3.1, funde IM2COL+MatMul em convolução nativa, habilita suporte a Whisper.cpp e ativa Qwen3.5 em NPU com shapes estáticos corrigidos (s_copy dinâmico que propagava slots dinâmicos via GET_ROWS). Adiciona debugging gated por env-var e correções em ggml_rope_set_offset. Amplia cobertura de inference heterogênea em Intel iGPU/NPU com quantização e streaming de áudio.
llama.cpp b10670 — SYCL: TILE para KV decode quantizado em Intel BMG (Xe2)
GitHub ggml-org/llama.cpp — 2026-08-28
Roteia o path de KV decode quantizado para TILE apenas em Xe2/Battlemage, mantendo VEC nas demais arquiteturas até validação. A troca explora tiling eficiente de matriz em hardware Xe2 para decode autoregressivo quantizado (Q4/Q8), reduzindo latência por token em contexto longo. Relevante para serving quantizado em Intel Arc B-series e data center com backend SYCL/oneAPI.
llama.cpp b10669 — SYCL: bind in-place do KV cache f16 para SDPA oneDNN
GitHub ggml-org/llama.cpp — 2026-08-28
Vincula o KV cache f16 diretamente no path SDPA do oneDNN, eliminando cópias staged que custavam ~4,56 GB por ubatch de 2048 tokens a 34k de KV vivo (71,3 MB por tensor). A medição em Qwen3.8-27B Q4_K_S com GGML_SCHED_DEBUG=2 mostra que o custo escala com KV length, caindo para 0,27 GB no primeiro ubatch. Melhoria de largura de banda crítica para prefill longo em Intel GPUs via SYCL.
llama.cpp b10668 — tunings FA-vec para M3 Max, M5 e M5 Pro
GitHub ggml-org/llama.cpp — 2026-08-28
Adiciona registros fa_vec_tuned para Apple M3 Max, M5 e M5 Pro, gerados com ggml-metal-tuning fa-vec --dtype f16,q8_0 em dispositivos reais M5/M5 Pro. Os tunings refinam parâmetros de FlashAttention vetorizado para a família M3-M5, melhorando throughput de attention quantizada em Metal. Sequência de contribuições coordenadas após efeda76b para cobertura completa de Apple Silicon em inference local.
llama.cpp b10667 — tunings FA-vec para Apple M4 Pro
GitHub ggml-org/llama.cpp — 2026-08-28
Inclui tabelas fa_vec_tuned para Apple M4 Pro (MacBook Pro 14" Nov 2024), com sweep de 1h13m via ggml-metal-tuning em Metal. Cobre f16 e q8_0, otimizando kernels de attention para o GPU do M4 Pro sem carga concorrente. Parte do esforço contínuo de tuning discutido em #27668 para maximizar inference on-device quantizada em Apple Silicon.
llama.cpp b10666 — testes save/load state para todas as arquiteturas
GitHub ggml-org/llama.cpp — 2026-08-28
Expande test-save-load-state de um único modelo (tinyllamas/stories15M, arch llama) para varrer todos os *.gguf de um diretório com modo --models DIR, relatando PASS/FAIL por modelo e falhando não-zero se qualquer arquitetura quebrar. Acopla ao fixture generate-models via test-llama-archs e eleva contexto de treinamento dummy de 128 para 256 para acomodar padding por sequência. Melhora harness de CI para validar serialização de estado (KV, recurrent) entre arquiteturas e quantizações.
Nota de cobertura: buscas nativas nos 10 idiomas (pt, en, it, es, fr, de, ru, zh, ko, ja) com foco em harness/skills/modelos LLM, inference, quantização, fine-tuning e arquitetura (lm-eval-harness, vLLM, llama.cpp, agentes, quantização, tokenizers). Foram varridos releases de llama.cpp (12 em D, todos incluídos), ggml, vLLM (sem release em D, último v0.28.0 em 2026-08-26), transformers (sem release em D), lm-evaluation-harness (sem release em D), SGLang, Unsloth, Ollama, arXiv cs.* (0 papers com published UTC em [2026-08-28 03:00, 2026-08-29 03:00) — janela BRT sem publicação) e Hugging Face blog (nenhum post em D na janela BRT). Softwares genéricos com IA integrada foram excluídos. Lacuna: nenhum paper arXiv/LM novo com data verificável em D e nenhum modelo Hugging Face trending com lastModified em D.