用滑窗推理+压缩摘要的动态上下文管理让8B模型刷新SWE-Bench记录
Shuquan Lian, Juncheng Liu, Yazhe Chen, Yuhong Chen, Hui Li
2026-04-14
LLM智能体
上下文管理
强化学习
推理效率
软件工程
用医学知识库合成可控分布的推理题并通过半监督RL缓解罕见病数据稀缺。
Haolin Li, Shuyang Jiang, Ruipeng Zhang, Jiangchao Yao, Ya Zhang, Yanfeng Wang
2026-04-14
医疗大模型
半监督学习
强化学习
数据合成
知识增强
训练LLM在隐私对话中扮演双面间谍:用RL学会主动建模并误导攻击者信念。
Hanqi Xiao, Vaidehi Patil, Zaid Khan, Hyunji Lee, Elias Stengel-Eskin, Mohit Bansal
2026-04-14
LLM智能体
信念引导
多轮对话
强化学习
心智理论
先抽取结构化事件证据再做推理,并用P-FAB解决多目标RL的Pareto冲突。
Zinuo Li, Yongxin Guo, Jun Liu, Jiawei Zhan, Xi Jiang, Chengjie Wang,...
2026-04-13
Pareto优化
多模态推理
强化学习
时序定位
结构化证据
筛选少量高方差用户提示,让 RL 提示优化在异质推理任务上突破全量训练瓶颈。
Zhaolin Gao, Yu, Wang, Bo Liu, Thorsten Joachims, Kianté Brantley, Wen Sun
2026-04-13
大语言模型
奖励方差分析
强化学习
推理任务
提示优化
腾讯混元具身基础模型家族,MoT+自进化训练+蒸馏,2B 小模型 SOTA 22 基准。
Tencent Robotics X, HY Vision Team, Xumin Yu, Zuyan Liu, Ziyi Wang, He...
2026-04-10
Mixture-of-Transformers
具身智能
强化学习
机器人基础模型
知识蒸馏
用高斯分布匹配重写GRPO优势函数,破解多任务奖励拓扑不均衡。
Wenbo Hu, Xin Chen, Yan Gao-Tian, Yihe Deng, Nanyun Peng, Kai-Wei Chang
2026-04-10
GRPO
分布匹配
多模态大模型
强化学习
视觉推理
提出HDPO强化学习框架,解耦准确率与工具效率奖励,教会多模态智能体Metis“何时不用工具”。
Shilin Yan, Jintao Tong, Hongwei Xue, Xiaojun Tang, Yangyang Wang, Kunyu...
2026-04-10
GRPO
元认知
多模态大模型
工具使用
强化学习
把一致性与视觉接地作为硬约束的GRPO变体,让多模态推理既准又真。
Sai Srinivas Kancheti, Aditya Kanade, Rohit Sinha, Vineeth N...
2026-04-10
GRPO
多模态推理
强化学习
策略优化
视觉空间推理
用序列级强化学习一次性预测整条ISP流水线及参数,避免逐步决策的不稳定。
Jiyun Won, Heemin Yang, Woohyeok Kim, Jungseul Ok, Sunghyun Cho
2026-04-10
任务感知
低光增强
图像信号处理
实例分割
序列预测
提出 HiExp 框架,将搜索代理的随机探索转化为基于分层经验引导的策略性搜索
Chuzhan Hao, Wenfeng Feng, Guochao Jiang, Guofeng Quan, Guohua Liu, Yuewei Zhang
2026-04-10
RAG
多跳问答
强化学习
智能体搜索
经验蒸馏
揭示多轮LLM Agent RL中推理表面多样但输入无关的「模板坍缩」,并提出MI诊断与SNR过滤。
Zihan Wang, Chi Gui, Xing Jin, Qineng Wang, Licheng Liu, Kangrui Wang, Shiqi...
2026-04-09
LLM智能体
PPO/GRPO
互信息
信噪比
强化学习
Sol-RL 用 FP4 探索候选池,BF16 再生成关键样本,加速扩散 RL 4.64×。
Yitong Li, Junsong Chen, Shuchen Xue, Pengcuo Zeren, Siyuan Fu, Dinghao...
2026-04-09
FP4 量化
GRPO
强化学习
扩散模型
文本到图像
首个RL驱动的智能体图学习框架,让LLM自主用图原生工具搜索后做节点分类/链接预测。
Yuanfu Sun, Kang Li, Dongzhe Fan, Jiajin Liu, Qiaoyu Tan
2026-04-09
图学习
大语言模型
强化学习
文本属性图
智能体系统
HiLL:联合训练提示器与推理器,让 GRPO 在难题上找回学习信号。
Yu Xia, Canwen Xu, Zhewei Yao, Julian McAuley, Yuxiong He
2026-04-09
GRPO
协同训练
大语言模型推理
强化学习
提示学习
两阶段RLVR框架联合训练推理和自我改进,无需外部监督信号
Difan Jiao, Qianfeng Wen, Blair Yang, Zhenwei Tang, Ashton Anderson
2026-04-08
GRPO
RLVR
强化学习
数学推理
自我改进
统一扩散大语言模型后训练与评估的开源框架,支持多种模型家族和RL算法
Jingyi Yang, Yuxian Jiang, Xuhao Hu, Shuang Cheng, Biqing Qi, Jing Shao
2026-04-08
强化学习
扩散语言模型
模型对齐
系统优化
统一框架
针对LLM代码修复中的「过度编辑」问题,提出编辑感知奖励与自造数据框架,显著提升修复精度与推理速度。
Changxin Ke, Rui Zhang, Jiaming Guo, Yuanbo Wen, Li Ding, Shuo Wang, Xuyuan...
2026-04-08
代码修复
大语言模型
强化学习
推理加速
程序正确性
提出 SciTikZer 模型与 Dual Self-Consistency 强化学习框架,从图像生成可编译的 TikZ 代码,在 8B 体量上超越 Gemini-2.5-Pro 与 Qwen3-VL-235B。
Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu,...
2026-04-08
TikZ/LaTeX
代码生成
图像到代码
多模态大模型
强化学习
用数据工程而非架构创新,让1.2B小模型在文档解析上击败200倍参数的大模型。
Bin Wang, Tianyao He, Linke Ouyang, Fan Wu, Zhiyuan Zhao, Tao Chu, Yuan Qu,...
2026-04-07
OCR
强化学习
数据为中心AI
文档解析
视觉语言模型