用RL联合优化起草与编辑,让离散扩散驾驶规划真正学会自纠错。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
多模态学习
具身智能
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
多模态大语言模型
可解释性
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
用语义验证替代坐标监督,实现无标注的地理空间定位自进化
揭示 GRPO 中两种聚合规则的偏差,提出均衡聚合 BA。
在VLA架构中统一集成运动感知、长期记忆与物理感知三大功能模块
首个开源多模态深度搜索智能体训练配方,含数据管线、七工具环境与致命感知GRPO
三阶段管线,用黑盒对抗式在线策略蒸馏修复 SFT 分布漂移
首篇系统梳理 LLM 强化学习 rollout 设计的综述,提出 GFCR 四阶段框架。
首个高保真无人机具身搜救基准与仿真平台。
构建医疗 RL 训练场并提出 TT-OPD 自蒸馏框架解决多轮崩塌问题
通过token级思考截断与turn级动态重采样,让多轮智能体RL训练摆脱过思考困境。
用深度强化学习把表格数据清洗重定义为与表格基础模型先验对齐的序列决策问题。
并行训练多领域专家并在训练中持续互蒸馏,保持行为一致性以提升能力整合效率。
在图像编辑中利用基于验证器的强化学习
👍 59用CoT验证式奖励模型+GCPO算法显著提升图像编辑模型的指令遵循能力
Z.ai发布原生多模态智能体基座,集成CogViT与多任务RL。
构建 Claw 风格个人智能体训练数据合成、SFT/RL 训练与基准评测的端到端可扩展框架。
首个融合RLHF的音频推理模型,用偏好奖励突破RLVR多轮对话质量瓶颈
用强化学习把视频生成模型对齐 3D 几何,无需改架构即可获得 3D 一致性
提出 TEXOCR-Bench 基准与 2B 模型 TEXOCR,用 SFT+RLVR 把 PDF 页面恢复成可编译、结构一致的 LaTeX 源码。
在短上下文GRPO中按推理步置信度屏蔽优势,稳定高效压缩推理链。
Perceval:感知级PRM实现token级优势重分配