SparseDecoding:面向解码的免训练LLM剪枝框架
热点事件观察中
SparseDecoding:面向解码的免训练LLM剪枝框架
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
SparseDecoding 论文作者提出一种面向解码的免训练剪枝框架,用稠密模型自回归生成过程中逐层采集的激活(排除 prefill)构建校准矩阵,使剪枝目标与解码激活对齐;同时开发了带 bitmask 索引和固定步长遍历的优化 N:M 稀疏矩阵向量 kernel。作者称该方法在长文本生成基准上持续优于标准固定文本校准,并在 A100 GPU 上实现最高 1.48x 的端到端解码墙钟加速。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 08:00
SparseDecoding:面向解码的 LLM 剪枝框架,A100 上端到端解码提速最高 1.48x报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- Hugging Face 每日论文SparseDecoding:面向解码的 LLM 剪枝框架,A100 上端到端解码提速最高 1.48x
SparseDecoding 提出一种面向解码的免训练剪枝框架,用稠密模型自回归生成过程中逐层采集的激活构建校准矩阵(排除 prefill),使剪枝目标与解码激活对齐,并开发了带 bitmask 索引和固定步长遍历的优化 N:M 稀疏矩阵向量 kernel。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。