找到 79 条结果

用 9 类任务、9 种奖励的 23K RLVR 数据集和 TMN-Reweight 多任务优化算法,让 30B 模型长上下文能力逼近 R1-0528。

Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen,... 2026-05-20
GRPO RLVR 后训练 多任务学习 强化学习

提出注意力状态记忆,无训练地将长前缀外部化为查找记忆

Yasuyuki Okoshi, Hao Mark Chen, Guanxi Lu, Hongxiang Fan, Masato Motomura,... 2026-05-20
KV缓存 推理优化 注意力分解 注意力机制 长上下文

通过分块并行算法把逐步动量机制引入Delta线性注意力,在保持严格因果性的同时实现高效训练。

Yulong Huang, Xiang Liu, Hongxiang Huang, Xiaopeng Lin, Zunchang Liu,... 2026-05-11
动量优化器 序列建模 状态空间模型 线性注意力 长上下文

将注意力机制嵌入循环反馈通路,构造多跳路由的Sessa解码器,理论上获得ℓ^-β的多项式记忆衰减与灵活选择性检索能力。

Liubomyr Horbatko 2026-04-27
序列建模 架构设计 注意力机制 状态空间模型 理论分析

用强化学习训练一个轻量 Actor 在长上下文中插入高亮标记,提升冻结 LLM 的证据利用能力。

Shaoang Li, Yanhang Shi, Yufei Li, Mingfu Liang, Xiaohan Wei, Yunchen Pu,... 2026-04-27
可迁移性 强化学习 提示优化 证据选择 长上下文

通过双层优化引入参数记忆机制,解决扩散语言模型训练与推理不匹配和长上下文注意力稀释问题

Zehua Pei, Hui-Ling Zhen, Weizhe Lin, Sinno Jialin Pan, Yunhe Wang, Mingxuan... 2026-03-24
参数记忆 双层优化 快速权重 扩散语言模型 长上下文