"IA — notícias de 2026-08-29"
Fontes
llama.cpp b10688 — tunings FA-vec para Apple M2
GitHub ggml-org/llama.cpp · 2026-08-29
O release b10688 adiciona tabelas fa_vec_tuned para Apple M2 focadas em FlashAttention vetorial via Metal. Os tunings otimizam kernels de attention quantizados (f16/q8) para inference local em Macs com M2, melhorando tokens/s e eficiência energética. Segue a série de tunings M3/M4/M5 das últimas semanas para cobertura completa de Apple Silicon.
llama.cpp b10687 — OpenCL: novo caminho matmul para Adreno X2E e A7X
GitHub ggml-org/llama.cpp · 2026-08-29
O b10687 roteia matmuls OpenCL para caminhos mais rápidos em duas gerações Adreno. Em X2-90, ativa por padrão o GEMM F16xF32 via xmem, antes opt-in, que reduz de 40,8%% do tempo de prefill em gpt-oss-20b f16 para ganho de ~25%% em prefill; em A7X, desvia batched f32xf32 do tiled kernel que sofre spill de registradores, com ~9%% de ganho em gemma-3n-E4B no Adreno 740. Alterações são gated por geração e controláveis por GGML_OPENCL_A7X_F32_LM_BYPASS. Relevante para inference quantizada on-device em Snapdragon com aceleração Adreno.
llama.cpp b10686 — Metal: assert de padding em shared memory
GitHub ggml-org/llama.cpp · 2026-08-29
Correção de robustez no backend Metal que adiciona assertion para padding de shared memory, evitando layout incorreto em kernels Metal. Mudança de segurança que previne corrupção silenciosa de tensores em inference com GGUF quantizado em Apple Silicon. Complementa os tunings fa-vec da mesma janela.
llama.cpp b10685 — Metal: tunings FA-vec restantes para M4 Pro
GitHub ggml-org/llama.cpp · 2026-08-29
Complementa o b10673 ao incluir os tunings FA-vec remanescentes para Apple M4 Pro no ggml-metal-tuning.cpp. Otimiza FlashAttention vetorizado quantizado para o GPU do M4 Pro, cobrindo combinações de dtype f16/q8 restantes. Contribuição validada com sweep reproduzível via ggml-metal-tuning em Metal.
llama.cpp b10684 — SYCL: --fit respeita melhor --fit-target
GitHub ggml-org/llama.cpp · 2026-08-29
Melhora o algoritmo --fit no backend SYCL para considerar o pico real de VRAM com contexto totalmente utilizado, evitando OOM e ao mesmo tempo reduzindo reservas excessivamente conservadoras. Em teste com Arc B70 e Qwen3.8 Q4_K_XL, permite alcançar 262144 de contexto utilizável com KV q8_0, MTP e ubatch 4k usando --fit-target 1. Relevante para serving com contexto longo quantizado em Intel Arc/Battlemage via oneAPI.
llama.cpp b10683 — Vulkan: unificação de funções fastdiv
GitHub ggml-org/llama.cpp · 2026-08-29
Refatora o backend Vulkan combinando funções fastdiv duplicadas e renomeando a variante otimizada para divisões pequenas, removendo redundância no código de shaders. Limpeza reduz manutenção e prepara otimizações de dispatch MoE/MatMul em Vulkan. Sem mudança funcional, mas melhora manutenibilidade de kernels de inference sparse em AMD/NVIDIA via Vulkan.
llama.cpp b10682 — Metal: tunings FA-vec para M1 Max
GitHub ggml-org/llama.cpp · 2026-08-29
Adiciona registros fa_vec_tuned para Apple M1 Max, estendendo a cobertura de FlashAttention vetorizado quantizado para a geração M1. Os tunings são gerados via ggml-metal-tuning fa-vec e melhoram throughput de attention em Metal para modelos GGUF q4/q8 em Macs M1 Max. Parte do esforço contínuo de tuning para Apple Silicon iniciado em #27668.
llama.cpp b10681 — Vulkan: mul_mat_id passa a fazer padding em K em vez de N
GitHub ggml-org/llama.cpp · 2026-08-29
Corrige mul_mat_id no backend Vulkan para fazer padding na dimensão K em vez de N. Para mul_mat_id, o índice de linha é indiretado via lookup em shared memory, o que já evita OOB em N, mas o callback não checa limites em K. Mudança evita leituras fora de limites e melhora correção de MoE/attention em GPUs Vulkan.
Nota de cobertura: varredura em 10 idiomas (pt, en, it, es, fr, de, ru, zh, ko, ja) com consultas nativas para harnesses, skills, agentes, lm-eval, vLLM, llama.cpp, fine-tuning, quantização, inference e tokenizers. Verificação via arXiv API (cs.CL/cs.LG/cs.AI/cs.SE/stat.ML) não retornou papers com data publicada em D (2026-08-29 BRT) — a lista recente de cs.CL/cs.LG pula de 2026-08-28 para 2026-08-30, sem entradas para sábado 29, padrão de não-publicação de fim de semana. GitHub Releases API para vLLM, transformers, peft, tokenizers, ollama, DeepSpeed, diffusers, unsloth, axolotl e trl não apresentou tags com published_at em D; apenas ggml-org/llama.cpp publicou 8 tags em D (b10681–b10688), todas preservadas acima. Hugging Face papers/daily e buscas web com recorte temporal retornaram guias evergreen ou datas fora de D. Lacuna: nenhum release de lm-eval-harness, vLLM ou modelo em HuggingFace Hub com data verificável em 2026-08-29.