通过稀疏注意力、序列并行、量化和强化学习,实现高质量视频生成的1.64倍加速
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
多模态学习
具身智能
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
多模态大语言模型
可解释性
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
首个闭环视频世界模拟器,支持状态预测和奖励评估
利用SAE捕获模型内在属性指导RL数据工程,提升训练效率与性能
通过符号化元验证和解耦强化学习实现细粒度多模态视觉验证
将多智能体协调建模为在线策略学习问题,通过可审计的策略图动态优化技能、模型和拓扑选择
提出评估GUI代理在环境干扰下鲁棒性的基准和增强框架
9.8B 激活参数的 MoE 大模型,通过 Agent 数据管线+Forge 强化学习系统+自我进化,在编码与办公 Agent 任务上比肩头部闭源模型
用单源奖励作锚点,量化多源融合的信息增益
NoisyAgent:在训练中显式注入用户与工具噪声以提升LLM智能体鲁棒性
将长时程智能体的记忆管理建模为状态自适应问题,通过线索-页面架构实现意图驱动的记忆检索
三智能体对抗流水线为电脑操作代理规模化合成带可验证奖励的RLVR数据
首个支持单轮并行多工具调用的视频智能体RL框架PARA-GRPO,破解工具先验悖论。
SEAL:智能体与学习环境的协同共演化
👍 10提出基于验证器失败诊断的智能体-环境协同共演化框架 SEAL,用同一诊断信号同时驱动训练接口进化与策略梯度更新。
面向定制化的多模态角色扮演
👍 10提出 CMRP 新任务和 UniCharacter 框架,用极少样本让统一多模态模型同时学会角色的语言风格与视觉外观。
把终端输出 token 当作监督信号,叠加到 GRPO 损失上,让失败轨迹也产生梯度。
两阶段框架RTDMD统一DMD与RL,在4步内实现少步文生图SOTA。
揭示多时间尺度PPO中可微路由器被代理目标利用的失败模式并提出Target Decoupling。
通过协同进化策略与解码器解决离散AR T2I模型中的潜在协变量偏移问题
ETCHR:用编辑来澄清和驾驭视觉推理
👍 13用专用图像编辑器替代工具调用与统一多模态,让MLLM真正“用图像思考”。
用全轨迹后视分析挑选失败步骤,仅在相关动作片段做反馈条件蒸馏。