用 9 类任务、9 种奖励的 23K RLVR 数据集和 TMN-Reweight 多任务优化算法,让 30B 模型长上下文能力逼近 R1-0528。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用上下文地图缓存可重用的方向性知识,提升LLM代理处理重复长上下文任务的效率
用于高效长上下文生成的上下文记忆
👍 6提出注意力状态记忆,无训练地将长前缀外部化为查找记忆
首个统一对比长上下文LVLM与记忆增强代理的多模态长期记忆基准
Lighthouse:训练期对称Q/K/V金字塔+Top-K,续训恢复全注意力
用5B token长文档VQA把Qwen2.5-VL从32K扩到128K并外推至512K。
首个 ICU 时序临床决策基准,用事后标注揭示 LLM 在长程推理中的两大失效模式。
δ-mem:面向大语言模型的高效在线记忆机制
👍 131用 8×8 在线联想记忆增强冻结 LLM,平均分提升 1.10×
在 token 级稀疏选择,让任意 LLM 架构的 prefill 加速并集成 vLLM。
用强化学习微调嵌入器而非LLM,在10M tokens长上下文上实现SOTA多步检索。
通过分块并行算法把逐步动量机制引入Delta线性注意力,在保持严格因果性的同时实现高效训练。
首个针对长上下文LLM的优化式红队加速框架,2-7倍提速、2-4倍省显存。
Sessa:选择性状态空间注意力
👍 14将注意力机制嵌入循环反馈通路,构造多跳路由的Sessa解码器,理论上获得ℓ^-β的多项式记忆衰减与灵活选择性检索能力。
面向冻结 LLM 的证据高亮学习
👍 6用强化学习训练一个轻量 Actor 在长上下文中插入高亮标记,提升冻结 LLM 的证据利用能力。
通过只更新Q/K投影中高幅度激活对应的权重行实现长上下文RL稀疏更新。
通过分层索引加速稀疏注意力的token选择,实现3.75倍内核加速
稀疏注意力+文档级RoPE,端到端训练实现1亿token线性扩展
提出大规模多参考图像生成数据集和基准,解决现有模型在长上下文场景下的性能退化问题
通过双层优化引入参数记忆机制,解决扩散语言模型训练与推理不匹配和长上下文注意力稀释问题
免训练的层次化提示压缩框架,将推理延迟降低26.4倍同时保持高精度检索