Pular para o conteúdo principal

"IA — notícias de 2026-08-30"

· 8 min para ler

Fontes

llama.cpp b10689 — alloc dependencies em graph_optimize

GitHub ggml-org/llama.cpp · 2026-08-30

Permite passar dependências de alocação em ggml_graph_optimize, com novos testes de alocação para validar o caminho. Melhora o planejamento de memória de grafos de inference, evitando realocações e permitindo otimização mais agressiva de buffers em backends como CUDA e Metal. Relevante para serving GGUF quantizado com grafos otimizados.

Abrir fonte

llama.cpp b10690 — correção de Hadamard em context shift sem quantização

GitHub ggml-org/llama.cpp · 2026-08-30

Corrige cópia da matriz de Hadamard para o tensor k_rot apenas quando há buffer alocado, prevenindo crash durante context shift com K-cache não quantizado. Falha afetava rotação de chaves em contexto longo sem quantização de cache. Aumenta robustez de inference com janela estendida em CPU/Metal/CUDA.

Abrir fonte

llama.cpp b10691 — Metal corrige crash de pipeline nulo em mul_mat F16

GitHub ggml-org/llama.cpp · 2026-08-30

Corrige crash por pipeline nulo em mul_mat/mul_mat_id com src1 em F16 no backend Metal, falhando de forma fechada em shapes sem kernel F16 e abortando em pipeline nil no encoder. Evita falhas silenciosas e corrupção em inference quantizada mista em Apple Silicon. Complementa série de fixes Metal da janela.

Abrir fonte

llama.cpp b10692 — SYCL divide linhas longas em TOP_K

GitHub ggml-org/llama.cpp · 2026-08-30

Altera TOP_K no SYCL para dividir linhas longas em vez de um work-group por linha, paralelizando melhor logits de vocabulário grande. Reduz latência de sampling e melhora ocupação em Intel Arc/Battlemage via oneAPI. Útil para decode com top-k/top-p em modelos com vocabulário estendido.

Abrir fonte

llama.cpp b10693 — Hexagon: descoberta de dispositivo e sessões sob demanda

GitHub ggml-org/llama.cpp · 2026-08-30

Adiciona suporte a descoberta de dispositivos e criação de sessões sob demanda no backend Hexagon com alocação lazy e limpeza de interfaces. Viabiliza inference em DSPs Hexagon de Snapdragon com gerenciamento eficiente de sessões para MoE e modelos quantizados. Expande cobertura heterogênea para edge com NPU/DSP.

Abrir fonte

llama.cpp b10694 — RPC corrige compatibilidade com macOS pré-RDMA

GitHub ggml-org/llama.cpp · 2026-08-30

Corrige backend RPC para versões de macOS anteriores ao suporte RDMA, evitando falha de inicialização do transporte remoto. Garante offloading distribuído via RPC em Macs antigos sem RDMA. Relevante para clusters híbridos Apple Silicon com RPC.

Abrir fonte

llama.cpp b10695 — vendor atualiza cpp-httplib para 0.54.1

GitHub ggml-org/llama.cpp · 2026-08-30

Atualiza a dependência cpp-httplib para 0.54.0/0.54.1 no servidor HTTP OpenAI-compatível do llama.cpp. Traz correções de HTTP e segurança para o servidor de inference. Sem mudança de API, mas melhora estabilidade do serving via API compatível com vLLM/Ollama.

Abrir fonte

llama.cpp b10696 — Metal: tuning FA-vec para Apple M3 Pro

GitHub ggml-org/llama.cpp · 2026-08-30

Adiciona tabelas fa_vec tuned para Apple M3 Pro, no contexto do tracking #27668 de tuning FlashAttention vetorizado. Otimiza kernels de attention quantizada (f16/q8) em Metal, elevando tokens/s em Macs M3 Pro. Parte do esforço coordenado para cobertura Apple Silicon.

Abrir fonte

llama.cpp b10697 — Metal: tuning FA-vec para M3 Ultra

GitHub ggml-org/llama.cpp · 2026-08-30

Inclui tunings FA-vec para Apple M3 Ultra, estendendo o trabalho de tuning Metal para o topo da linha Apple Silicon. Melhora throughput de attention em modelos GGUF q4/q8 no M3 Ultra com parâmetros calibrados em hardware real. Relevante para inference local de alto desempenho em Mac Studio.

Abrir fonte

llama.cpp b10698 — RPC corrige spew de erro RDMA Apple no teardown

GitHub ggml-org/llama.cpp · 2026-08-30

Corrige emissão excessiva de erros RDMA da Apple durante teardown do backend RPC. Reduz ruído de logs e evita falsos alertas em encerramento de sessões distribuídas. Melhoria de observabilidade para deployments RPC em macOS.

Abrir fonte

llama.cpp b10699 — ggml: ggml_backend_op_alloc_size_may_expand para backends com memória extra

GitHub ggml-org/llama.cpp · 2026-08-30

Introduz ggml_backend_op_alloc_size_may_expand para backends que exigem memória adicional para dados efêmeros (Metal, SYCL, WebGPU) e usa no RPC. Reflete overhead de alocação que antes era subestimado, evitando OOM e corrupção em operações que expandem temporariamente. Crítico para inference quantizada em backends com staging extra.

Abrir fonte

llama.cpp b10700 — renomeia --tensor-read-lazy para --lazy-mode (-lzm)

GitHub ggml-org/llama.cpp · 2026-08-30

Renomeia o argumento CLI --tensor-read-lazy para --lazy-mode com atalho -lzm, alinhando com o parâmetro interno lazy_mode. Facilita uso de carregamento lazy de tensores para reduzir pico de RAM/VRAM ao carregar GGUF grandes. Mantém compatibilidade de plumbing interno e melhora ergonomia do harness.

Abrir fonte

llama.cpp b10701 — DFlash corrige escalas NVFP4 ausentes em attention

GitHub ggml-org/llama.cpp · 2026-08-30

Corrige passagem de escalas NVFP4 faltantes para operações de attention no caminho DFlash2, que fazia modelos draft NVFP4 quase não terem tokens aceitos em speculative decoding. Restaura taxa de aceitação de draft com quantização NVFP4, recuperando speedup de decoding especulativo para modelos quantizados de baixa precisão em Blackwell e similares.

Abrir fonte

llama.cpp b10702 — HIP otimiza caminho Q2_0 dot-product para gfx1201

GitHub ggml-org/llama.cpp · 2026-08-30

Otimiza o caminho vec_dot_q2_0_q8_1 para gfx1201 (RDNA4) com perm nativa amdgcn, ampliando otimização de perm Q2_0 no HIP. Acelera matmul quantizado Q2_0 em GPUs AMD RDNA4 via ROCm. Ganho direto para inference GGUF Q2_K/Q2_0 em Radeon RX de nova geração.

Abrir fonte

llama.cpp b10703 — HIP: tuning de config MMQ para RDNA3

GitHub ggml-org/llama.cpp · 2026-08-30

Ajusta configuração MMQ para RDNA3 no backend HIP, refinando tiling e paralelismo de matmul quantizado. Melhora throughput em GPUs AMD RDNA3 (7900 XT/XTX) para GGUF Q4/Q5. Parte do tuning contínuo de HIP para cobrir RDNA3 e RDNA4.

Abrir fonte

llama.cpp b10704 — CUDA usa caminho rápido mm_ids_helper para qualquer n_expert_used

GitHub ggml-org/llama.cpp · 2026-08-30

Generaliza o caminho rápido mm_ids_helper em CUDA para qualquer n_expert_used, antes restrito a warp_size % n_expert_used == 0. Remove hardcode e agrupa warp lanes por token para MoE, acelerando mul_mat_id em modelos mixture-of-experts. Beneficia inference de MoE esparsos como Qwen e DeepSeek em NVIDIA.

Abrir fonte

llama.cpp b10705 — melhora manuseio de TENSOR_READ_LAZY em llama

GitHub ggml-org/llama.cpp · 2026-08-30

Melhora o tratamento de TENSOR_READ_LAZY no núcleo llama, forçando tensor lazy em CPU quando lazy está ativo. Corrige interação entre carregamento lazy e placement de tensores, reduzindo cópias e pico de memória. Complementa a renomeação para --lazy-mode do b10700.

Abrir fonte

llama.cpp b10706 — ggml adiciona SWIGLU_CLAMP

GitHub ggml-org/llama.cpp · 2026-08-30

Adiciona operação SWIGLU_CLAMP em ggml com shader Vulkan correspondente, suportando variante clamped de SwiGLU usada em arquiteturas recentes. Habilita execução correta de FFNs com clamp em backends GGML/Vulkan. Prepara suporte a modelos que usam ativação SwiGLU com limite.

Abrir fonte

Nota de cobertura: varredura em 10 idiomas (pt, en, it, es, fr, de, ru, zh, ko, ja) com consultas nativas para harnesses, skills, agentes, lm-eval, vLLM, llama.cpp, fine-tuning, quantização, inference e tokenizers. Verificação via arXiv API (cs.CL/cs.LG/cs.AI/cs.NE/cs.SE/stat.ML) não retornou papers com published ou updated em D — 2026-08-30 foi domingo, sem anúncio arXiv (padrão de não-publicação de fim de semana; janela BRT [2026-08-30 03:00 UTC, 2026-08-31 03:00 UTC) vazia). GitHub Releases API para vLLM (último v0.28.0 em 2026-08-26T09:46:30Z), transformers, peft, tokenizers, ollama, DeepSpeed, diffusers, unsloth, axolotl e trl não apresentou tags com published_at em D; apenas ggml-org/llama.cpp publicou tags em D (18 releases b10689–b10706, todas preservadas acima, verificadas via api.github.com). Hugging Face Hub (api/models) e buscas web com recorte temporal não retornaram modelo trending com lastModified em D dentro do escopo LLM inference/quantização; artigos secundários sobre vLLM 0.28.0 e Hy4 datam de 2026-08-26/29 fora da janela. Softwares genéricos com IA integrada foram excluídos. Lacuna: nenhum paper arXiv novo, nenhum release de lm-eval-harness/SGLang/vLLM e nenhum modelo relevante no Hub com data verificável em 2026-08-30 além dos 18 de llama.cpp.