跳到正文
热点事件观察中

SparseDecoding:面向解码的免训练LLM剪枝框架

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

SparseDecoding 论文作者提出一种面向解码的免训练剪枝框架,用稠密模型自回归生成过程中逐层采集的激活(排除 prefill)构建校准矩阵,使剪枝目标与解码激活对齐;同时开发了带 bitmask 索引和固定步长遍历的优化 N:M 稀疏矩阵向量 kernel。作者称该方法在长文本生成基准上持续优于标准固定文本校准,并在 A100 GPU 上实现最高 1.48x 的端到端解码墙钟加速。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. Hugging Face 每日论文
    SparseDecoding:面向解码的 LLM 剪枝框架,A100 上端到端解码提速最高 1.48x

    SparseDecoding 提出一种面向解码的免训练剪枝框架,用稠密模型自回归生成过程中逐层采集的激活构建校准矩阵(排除 prefill),使剪枝目标与解码激活对齐,并开发了带 bitmask 索引和固定步长遍历的优化 N:M 稀疏矩阵向量 kernel。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。