基于宝可梦的大规模AI决策基准,含对战与速通双赛道评估框架
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
系统比较SFT和RL在LLM后训练中的作用、差异与融合方法
通过对抗性协同进化优化代码和测试生成,消除对人工标注测试的依赖
训练时用自适应视觉提示引导模型学习时空定位,推理时无需额外工具
VST让视频大模型在流式观看时同步推理,兼顾实时响应与深度思考
提出生成式视觉奖励模型Visual-ERM,通过细粒度图像对比为图表/表格/SVG转代码任务提供可靠RL奖励信号
通过增强条件空间构建多视角奖励映射,提升流模型GRPO对齐效果
统一框架实现多主体身份保持与全方位运动控制,通过潜在空间强化学习优化身份保真度
用字形引导SFT+多目标RL解决图像内文字编辑难题,330K数据+15语言基准
提出FIRM框架,通过专门训练的奖励模型和新颖的奖励策略,解决图像编辑与生成中强化学习奖励信号不可靠的问题。
用自动生成的细粒度评分准则作为RL奖励信号,让小模型生成超越人类和大模型的图像描述
基于元强化学习与自我反思的智能体搜索
👍 11MR-Search:元RL结合自我反思解决稀疏奖励下的智能体搜索
ROVA框架通过结构化时空扰动与自反思难度调度,提升视频推理在真实世界扰动下的鲁棒性
用LLM编码代理自动翻译RL环境,4级验证保等价。
证据优先合成智能体任务,扩展多样性以提升工具使用泛化能力
提出TeamHOI框架,用单一去中心化策略实现2-8个人形机器人的协作搬运任务
利用群体级自然语言反馈引导强化学习中的探索
👍 211聚合外部批评与组内对比两种NL反馈,以离策略脚手架引导RL探索,实现2.2倍样本效率提升
利用用户交互的下一状态信号在线优化个人和通用智能体的RL框架
ICRL:纯RL框架实现LLM工具调用,无需SFT,渐进消除少样本提示
通过强化学习训练路由器,解决LoRA混合模型中路由权重塌陷问题