用RL诱导模型重建训练数据实现更强MIA
Junjie Oscar Yin, John X. Morris, Vitaly Shmatikov, Sewon Min, Hannaneh Hajishirzi
2026-02-25
强化学习
成员推理攻击
数据隐私
训练数据检测
语言模型安全
提出结构异常感知的强化学习奖励,显著提升文本到图像模型的文字渲染质量
Hanshen Zhu, Yuliang Liu, Xuecheng Wu, An-Lan Wang, Hao Feng, Dingkang Yang,...
2026-02-25
OCR评估
强化学习
文本渲染
结构感知
视觉文本生成
用技能手册实现高效可解释的多智能体编排,替代昂贵的RL训练
Jiayu Wang, Yifei Ming, Zixuan Ke, Shafiq Joty, Aws Albarghouthi, Frederic Sala
2026-02-24
LLM编排
多智能体系统
强化学习
技能学习
模型路由
从 VLM 的 token 概率中提取隐式任务进度信号,实现零样本机器人奖励估计
Shirui Chen, Cole Harrison, Ying-Chun Lee, Angela Jin Yang, Zhongzheng Ren,...
2026-02-24
奖励建模
强化学习
机器人学
视觉语言模型
零样本学习
在仿真中用程序化生成物体训练单一目标条件策略,实现零样本迁移到真实世界多样化工具操作
Kushal Kedia, Tyler Ga Wei Lum, Jeannette Bohg, C. Karen Liu
2026-02-24
仿真到真实迁移
工具操作
强化学习
灵巧操作
零样本泛化
通过双尺度多样性正则化促进LLM推理中的深度探索
Zhongwei Wan, Yun Shen, Zhihao Dou, Donghao Zhou, Yu Zhang, Xin Wang, Hui...
2026-02-24
RLVR
多样性探索
大语言模型推理
强化学习
数学推理
通过混合知识注入框架将时间序列专家知识注入通用推理模型,解决时间序列诊断推理中的知识鸿沟问题
Zelin He, Boran Han, Xiyuan Zhang, Shuai Zhang, Haotian Lin, Qi Zhu, Haoyang...
2026-02-24
多模态大模型
强化学习
时间序列推理
知识注入
诊断推理
基于蛋白质语言模型和强化学习的AAV衣壳设计框架,优化多目标功能特性
Mohammadreza Ghaffarzadeh-Esfahani, Yousof Gheisari
2026-02-24
基因治疗
强化学习
生成式AI
病毒载体设计
蛋白质工程
发现大推理模型隐式具备适时停止思考的能力,提出SAGE采样范式释放该潜力,同时提升准确率和推理效率
Zixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng, Xuanda Wang, Zhixia Zhang,...
2026-02-23
大推理模型
强化学习
思维链压缩
推理效率
采样策略
变分推导闭式重要性权重核,64×陈旧下稳定LLM训练
Guobin Shen, Chenxiao Zhao, Xiang Cheng, Lei Huang, Xing Yu
2026-02-23
大语言模型
强化学习
方差缩减
策略优化
重要性采样
通过教师-学生蒸馏框架,让移动机器人仅凭自我视角完成多物体长期推放任务
Boyuan An, Zhexiong Wang, Yipeng Wang, Jiaqi Li, Sihang Li, Jing Zhang, Chen Feng
2026-02-23
强化学习
机器人学习
模仿学习
视角受限规划
非抓取操作
提出10.3万规模的多模态数学数据集,通过三阶段自动清洗管道构建,显著提升视觉推理能力
Haoxiang Sun, Lizhen Xu, Bing Zhao, Wotao Yin, Wei Wang, Boyu Yang, Rui Wang, Hu Wei
2026-02-23
多模态推理
强化学习
数学推理
数据集构建
视觉语言模型
用雅可比惩罚+线性策略网络实现高效平滑的角色动画控制
Zhaoming Xie, Kevin Karol, Jessica Hodgins
2026-02-23
动作平滑
强化学习
机器人控制
物理角色动画
线性反馈控制
提出GUI-Owl-1.5模型家族,通过混合数据飞轮和多平台RL扩展实现跨设备GUI自动化
Haiyang Xu, Xi Zhang, Haowei Liu, Junyang Wang, Zhaozai Zhu, Shengjie Zhou,...
2026-02-20
GUI Agent
多平台自动化
多模态大模型
工具调用
强化学习
提出首个桌面软件世界模型CUWM,通过文本+视觉两阶段分解预测UI状态转换,提升智能体决策质量
Yiming Guan, Rui Yu, John Zhang, Lu Wang, Chaoyun Zhang, Liqun Li, Bo Qiao,...
2026-02-20
GUI智能体
世界模型
强化学习
桌面软件
测试时规划
用FSM建模网页状态转移,自动生成可验证的合成网页环境和训练轨迹
Yifan Wu, Yiran Peng, Yiyu Chen, Jianhao Ruan, Zijie Zhuang, Cheng Yang,...
2026-02-19
GUI交互
Web Agent
合成数据
强化学习
有限状态机
REFINE:用RL序列级反馈优化快速权重模型的长上下文能力
Hee Seung Hwang, Xindi Wu, Sanghyuk Chun, Olga Russakovsky
2026-02-19
序列预测
强化学习
快速权重
语言模型
长上下文建模
智谱旗舰模型GLM-5,通过DSA、异步RL和大规模智能体训练实现前沿性能。
GLM-5 Team, Aohan Zeng, Xin Lv, Zhenyu Hou, Zhengxiao Du, Qinkai Zheng, Bin...
2026-02-18
大语言模型
强化学习
智能体
稀疏注意力
软件工程
通过Reason-Reflect-Refine框架将理解嵌入生成过程,解决多模态模型中生成与理解的权衡问题
Sen Ye, Mengde Xu, Shuyang Gu, Di He, Liwei Wang, Han Hu
2026-02-18
图像生成
多模态模型
强化学习
视觉理解
迭代优化
屏蔽0.01%伪标记token,稳定RL训练并提升LLM推理准确率
Shiqi Liu, Zeyu He, Guojian Zhan, Letian Tao, Zhilong Zheng, Jiang Wu, Yinuo...
2026-02-18
token级别优化
大语言模型
强化学习
推理能力
训练稳定性