找到 999 条结果

用RL诱导模型重建训练数据实现更强MIA

Junjie Oscar Yin, John X. Morris, Vitaly Shmatikov, Sewon Min, Hannaneh Hajishirzi 2026-02-25
强化学习 成员推理攻击 数据隐私 训练数据检测 语言模型安全

通过混合知识注入框架将时间序列专家知识注入通用推理模型,解决时间序列诊断推理中的知识鸿沟问题

Zelin He, Boran Han, Xiyuan Zhang, Shuai Zhang, Haotian Lin, Qi Zhu, Haoyang... 2026-02-24
多模态大模型 强化学习 时间序列推理 知识注入 诊断推理

发现大推理模型隐式具备适时停止思考的能力,提出SAGE采样范式释放该潜力,同时提升准确率和推理效率

Zixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng, Xuanda Wang, Zhixia Zhang,... 2026-02-23
大推理模型 强化学习 思维链压缩 推理效率 采样策略

提出GUI-Owl-1.5模型家族,通过混合数据飞轮和多平台RL扩展实现跨设备GUI自动化

Haiyang Xu, Xi Zhang, Haowei Liu, Junyang Wang, Zhaozai Zhu, Shengjie Zhou,... 2026-02-20
GUI Agent 多平台自动化 多模态大模型 工具调用 强化学习

智谱旗舰模型GLM-5,通过DSA、异步RL和大规模智能体训练实现前沿性能。

GLM-5 Team, Aohan Zeng, Xin Lv, Zhenyu Hou, Zhengxiao Du, Qinkai Zheng, Bin... 2026-02-18
大语言模型 强化学习 智能体 稀疏注意力 软件工程

通过Reason-Reflect-Refine框架将理解嵌入生成过程,解决多模态模型中生成与理解的权衡问题

Sen Ye, Mengde Xu, Shuyang Gu, Di He, Liwei Wang, Han Hu 2026-02-18
图像生成 多模态模型 强化学习 视觉理解 迭代优化