通过填空式多选题构造,将不可验证文本转化为可用RL训练数据
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
一个完全自动化的端到端框架,通过可扩展的数据合成和可验证的强化学习来训练工具增强的语言智能体。
测试时课程合成:面向自进化的协同训练框架
👍 35通过合成课程问题与求解器协同进化,实现测试时自适应推理提升
RLVR优化的推理模型作为嵌入模型骨干时并无优势,但对比学习可对齐两者
将文本记忆渲染为视觉图像,通过自适应信息密度突破上下文预算瓶颈
用逐步密集奖励和自适应噪声校准改进流匹配模型的人类偏好对齐
超越语义的实时对齐奖励模型
👍 15利用策略模型隐藏状态实时更新奖励模型,解决RLHF中的奖励过度优化问题
SSL:智能体优化中差异化引导的甜点学习
👍 12通过分层奖励将策略引导至解空间最优区域,实现样本效率提升2.5倍
轻量奖励模型预测单元测试质量,无需编译运行即可评估覆盖率和变异得分
使用过程奖励扩展多智能体系统
👍 8通过AI反馈的逐动作过程奖励训练多智能体,解决信用分配和样本效率问题
FISSION-GRPO 框架:将执行错误转化为在线策略纠正性监督,提升工具使用错误恢复能力。
将隐式推理重新定义为潜在空间规划,实现动态终止和可解释性
首个端到端统一文本OCR与视觉OCR的全场景方法,4B参数媲美70B模型。
探索面向智能体的推理奖励模型
👍 24提出多维度推理奖励模型Agent-RRM,通过文本批评和标量奖励的统一集成提升智能体性能
用强后训练模型作为rewriter和judge改进预训练阶段
用轻量级神经网络探索环境,再蒸馏到LLM并用RL激活,大幅提升非语言任务性能
首个开源网络安全推理模型,8B参数媲美70B模型性能
超越模仿:面向主动潜在规划的强化学习方法
👍 10通过VAE和强化学习,主动优化隐空间中的推理策略,提升准确率并减少token消耗
用LLM评估器回答自然语言元问题作为奖励信号,无需真值标签即可训练语言模型
基于流的极值数学结构发现
👍 2FlowBoost:用流匹配+强化学习自动发现极值几何配置