找到 79 条结果

保留少数垂直线token和局部窗口为全精度,其余低比特量化,实现近无损长上下文推理加速

Jiatong Ding, Bingxin Xing, Yu Zhang, Dian Ding, Xiaodong Yi, Xianbin... 2026-09-11
KV缓存压缩 LLM推理加速 模型量化 注意力机制 混合精度

零训练的带槽滑窗注意力在短长上下文任务上追平甚至碾压昂贵的后训练线性注意力

Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais 2026-08-31
KV缓存 LLM推理效率 注意力机制 滑窗注意力 线性注意力

首个开源3T级原生多模态MoE,配1M上下文与多档强化学习

Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, M. C., Jianfeng Cai, Xinyuan... 2026-07-28
Mixture-of-Experts 原生多模态 大语言模型 智能体强化学习 长上下文

让LLM自主选择训练片段提升长上下文推理性能

Xinyu Zhu, Zhe Xu, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Kaushik... 2026-07-13
参数高效微调 注意力机制 测试时训练 自适应推理 长上下文

30B总参数仅激活3B的双语MoE模型,长上下文服务效率领先,德语能力突出

The Soofi-Team, Benedikt Droste, David Fitzek, Ruben Härle, Lukas Helff,... 2026-07-13
Mixture-of-Experts 多语言模型 开源模型 德语模型 混合架构