用三智能体自动构建可执行工具环境,并合成自然多轮轨迹训练工具调用LLM。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
多模态学习
具身智能
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
多模态大语言模型
可解释性
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
把VLM训练成导演理解分镜创意意图,再统一控制信号注入视频生成
用正反答案对比信号解决 RLVR 中 token 级信用分配难题
视频模型可通过可验证奖励进行推理
👍 11VideoRLVR框架用可验证奖励优化视频模型,提升规则验证任务的推理能力
通过动态调整rubric标准的权重,将训练压力导向当前策略可学习的标准,提升多目标强化学习效率
用自生成多解数据做中段训练,显著提升后续强化学习
KVPO:面向流式自回归视频生成,在ODE原生范式下做KV语义探索的偏好对齐
统一检索与编译器反馈为可训练策略,构建OProofs语料,在五项Lean4基准上取得SOTA
用自进化的视觉热图替代文本记忆与教师 LLM,为 3B VLM 智能体注入密集空间奖励。
构建GRASP数据集并提出SGR奖励,使MLLM能基于注视手势进行多人交互推理
冻结LLM权重,用四智能体+可训练知识图谱的闭环系统让代码生成越用越强。
用 Hölder 平均统一 GRPO 系列聚合方式,提出动态 p 退火。
首个端到端联合优化设计者与执行者的自动多智能体强化学习框架。
针对几何画图的点级精度需求,提出依赖结构规划+像素级执行的GUI智能体框架
提出可量化指标 ECC 与交错训练策略,系统性解决 LLM 智能体在新环境中的过早利用失败。
用 LLM 先验从纯观测轨迹中归纳可执行 POMDP,摆脱对真实隐藏状态的依赖。
三阶段审计揭示物理VLM评测三大测量偏差,并发布干净语料+RL配方
通过简洁统一的扩展达成奥赛金牌级推理能力
👍 166把30B-A3B训成IMO/IPhO金牌级推理器:反向困惑度SFT+两级RL+TTS精炼。
门控自蒸馏 OPSD,稳健提升多轮 LLM 智能体 RL 训练。
用突变+多样性过滤把封闭题改造成开放式训练数据