找到 68 条结果

冻结AR权重、外挂LoRA扩散权重并行起草,AR验证实现全批量无损提速

Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham, Jonathan Geuter, Chaitanya... 2026-09-08
LoRA RL后训练加速 一致性蒸馏 扩散语言模型 投机解码

纯后训练专用模型家族,单次调用生成幻灯片与可交互课件,用可执行探针把交互性变成可测量的奖励信号

Shangqing Tu, Daniel Zhang-Li, Yucheng Wang, Shiyu Gan, Yanpeng Wang,... 2026-09-01
GRPO 后训练 国产算力适配 奖励攻击 奖励设计

用边界感知的LCA掩码让层级字节模型单头并行预测多字节,加速推理且性能基本不掉。

Abraham Toluwase Owodunni, Chibuzor Okocha, Christan Grant, Tomasz... 2026-08-19
多Token预测 字节级语言模型 层级架构 投机解码 推理加速

用LLM在残差式DSL空间中自动搜索视觉token剪枝策略,94.4%剪枝下保留99%以上性能

Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu 2026-08-14
AI4AI LLM驱动算法设计 多模态大模型 推理加速 视觉Token剪枝

用层级并行解码范式重构文档解析,吞吐量达4752 TPS。

Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan,... 2026-07-22
vLLM 多token预测 并行解码 推理加速 文档解析

通过内部模型路由引入轻量级中间验证器,实现分层推测解码,降低拒绝率并提升推理速度

Yuchen Xian, Yang He, Yunqiu Xu, Yi Yang 2026-06-12
KL散度 分层验证 推测解码 推理加速 模型压缩