找到 68 条结果

通过显式自适应记忆管理压缩LLM推理过程中的中间思维,大幅降低内存开销并提升推理效率

Yuqi Zhu, Jintian Zhang, Zhenjie Wan, Yujie Luo, Shuofei Qiao, Zhengke Gui,... 2026-04-07
KV缓存优化 内存管理 推理加速 链式思维 长上下文推理

通过频谱演化感知的缓存策略,在保留内容质量的同时加速扩散模型推理

Jiwoo Chung, Sangeek Hyun, MinKyu Lee, Byeongju Han, Geonho Cha, Dongyoon... 2026-02-26
图像生成 扩散模型 推理加速 缓存策略 视频生成

通过查询传播和融合,将视频分割统一到纯ViT编码器中,实现10倍加速且精度相当

Narges Norouzi, Idil Esen Zulfikar, Niccol`o Cavagnero, Tommie Kerssies,... 2026-02-23
Vision Transformer 基础模型 推理加速 编码器架构 视频分割

针对扩散语言模型中注意力汇聚不稳定的特点,提出感知汇聚的剪枝方法

Aidar Myrzakhan, Tianyi Li, Bowei Guo, Shengkun Tang, Zhiqiang Shen 2026-02-23
后训练剪枝 扩散语言模型 推理加速 模型压缩 注意力汇聚