Pular para o conteúdo principal

"IA — notícias de 2026-08-29"

· 5 min para ler

Fontes

llama.cpp b10688 — tunings FA-vec para Apple M2

GitHub ggml-org/llama.cpp · 2026-08-29

O release b10688 adiciona tabelas fa_vec_tuned para Apple M2 focadas em FlashAttention vetorial via Metal. Os tunings otimizam kernels de attention quantizados (f16/q8) para inference local em Macs com M2, melhorando tokens/s e eficiência energética. Segue a série de tunings M3/M4/M5 das últimas semanas para cobertura completa de Apple Silicon.

Abrir fonte

llama.cpp b10687 — OpenCL: novo caminho matmul para Adreno X2E e A7X

GitHub ggml-org/llama.cpp · 2026-08-29

O b10687 roteia matmuls OpenCL para caminhos mais rápidos em duas gerações Adreno. Em X2-90, ativa por padrão o GEMM F16xF32 via xmem, antes opt-in, que reduz de 40,8%% do tempo de prefill em gpt-oss-20b f16 para ganho de ~25%% em prefill; em A7X, desvia batched f32xf32 do tiled kernel que sofre spill de registradores, com ~9%% de ganho em gemma-3n-E4B no Adreno 740. Alterações são gated por geração e controláveis por GGML_OPENCL_A7X_F32_LM_BYPASS. Relevante para inference quantizada on-device em Snapdragon com aceleração Adreno.

Abrir fonte

llama.cpp b10686 — Metal: assert de padding em shared memory

GitHub ggml-org/llama.cpp · 2026-08-29

Correção de robustez no backend Metal que adiciona assertion para padding de shared memory, evitando layout incorreto em kernels Metal. Mudança de segurança que previne corrupção silenciosa de tensores em inference com GGUF quantizado em Apple Silicon. Complementa os tunings fa-vec da mesma janela.

Abrir fonte

llama.cpp b10685 — Metal: tunings FA-vec restantes para M4 Pro

GitHub ggml-org/llama.cpp · 2026-08-29

Complementa o b10673 ao incluir os tunings FA-vec remanescentes para Apple M4 Pro no ggml-metal-tuning.cpp. Otimiza FlashAttention vetorizado quantizado para o GPU do M4 Pro, cobrindo combinações de dtype f16/q8 restantes. Contribuição validada com sweep reproduzível via ggml-metal-tuning em Metal.

Abrir fonte

llama.cpp b10684 — SYCL: --fit respeita melhor --fit-target

GitHub ggml-org/llama.cpp · 2026-08-29

Melhora o algoritmo --fit no backend SYCL para considerar o pico real de VRAM com contexto totalmente utilizado, evitando OOM e ao mesmo tempo reduzindo reservas excessivamente conservadoras. Em teste com Arc B70 e Qwen3.8 Q4_K_XL, permite alcançar 262144 de contexto utilizável com KV q8_0, MTP e ubatch 4k usando --fit-target 1. Relevante para serving com contexto longo quantizado em Intel Arc/Battlemage via oneAPI.

Abrir fonte

llama.cpp b10683 — Vulkan: unificação de funções fastdiv

GitHub ggml-org/llama.cpp · 2026-08-29

Refatora o backend Vulkan combinando funções fastdiv duplicadas e renomeando a variante otimizada para divisões pequenas, removendo redundância no código de shaders. Limpeza reduz manutenção e prepara otimizações de dispatch MoE/MatMul em Vulkan. Sem mudança funcional, mas melhora manutenibilidade de kernels de inference sparse em AMD/NVIDIA via Vulkan.

Abrir fonte

llama.cpp b10682 — Metal: tunings FA-vec para M1 Max

GitHub ggml-org/llama.cpp · 2026-08-29

Adiciona registros fa_vec_tuned para Apple M1 Max, estendendo a cobertura de FlashAttention vetorizado quantizado para a geração M1. Os tunings são gerados via ggml-metal-tuning fa-vec e melhoram throughput de attention em Metal para modelos GGUF q4/q8 em Macs M1 Max. Parte do esforço contínuo de tuning para Apple Silicon iniciado em #27668.

Abrir fonte

llama.cpp b10681 — Vulkan: mul_mat_id passa a fazer padding em K em vez de N

GitHub ggml-org/llama.cpp · 2026-08-29

Corrige mul_mat_id no backend Vulkan para fazer padding na dimensão K em vez de N. Para mul_mat_id, o índice de linha é indiretado via lookup em shared memory, o que já evita OOB em N, mas o callback não checa limites em K. Mudança evita leituras fora de limites e melhora correção de MoE/attention em GPUs Vulkan.

Abrir fonte

Nota de cobertura: varredura em 10 idiomas (pt, en, it, es, fr, de, ru, zh, ko, ja) com consultas nativas para harnesses, skills, agentes, lm-eval, vLLM, llama.cpp, fine-tuning, quantização, inference e tokenizers. Verificação via arXiv API (cs.CL/cs.LG/cs.AI/cs.SE/stat.ML) não retornou papers com data publicada em D (2026-08-29 BRT) — a lista recente de cs.CL/cs.LG pula de 2026-08-28 para 2026-08-30, sem entradas para sábado 29, padrão de não-publicação de fim de semana. GitHub Releases API para vLLM, transformers, peft, tokenizers, ollama, DeepSpeed, diffusers, unsloth, axolotl e trl não apresentou tags com published_at em D; apenas ggml-org/llama.cpp publicou 8 tags em D (b10681–b10688), todas preservadas acima. Hugging Face papers/daily e buscas web com recorte temporal retornaram guias evergreen ou datas fora de D. Lacuna: nenhum release de lm-eval-harness, vLLM ou modelo em HuggingFace Hub com data verificável em 2026-08-29.