Hugging Face 每日论文·· 1 天前AI 评分55
SparseDecoding:面向解码的 LLM 剪枝框架,A100 上端到端解码提速最高 1.48x
SparseDecoding: Decoding-Aware Pruning for Accurate and Efficient LLM Inference
AI 导读
SparseDecoding 提出一种面向解码的免训练剪枝框架,用稠密模型自回归生成过程中逐层采集的激活构建校准矩阵(排除 prefill),使剪枝目标与解码激活对齐,并开发了带 bitmask 索引和固定步长遍历的优化 N:M 稀疏矩阵向量 kernel。
来源:Hugging Face 每日论文 · huggingface.co