提出判别器引导的强化学习(DRL),在不依赖人类偏好的情况下修正流匹配模型的分布偏差
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
双头 critic 解耦稀疏成功信号为可行性与效率,显著提升 VLA 微调效果
用 3D 轨迹作为视频到机器人动作的可复用中间表征,纯视频预训练即可匹敌有动作监督的 VLA。
在小波系数空间做流匹配,配合状态感知不确定性建模,单卡 10 步合成全分辨率 3D 脑 MRI
首个同时满足高保真、长时一致性和高效生成的机器人操作世界模型
将任意数量视图压缩为单一全局潜在,通过流匹配生成任意分辨率的3D表面重建
提出潜在空间流匹配模型,从乐谱生成可变长度的表现性钢琴演奏。
通过残差流适配器将预训练VLM离散解码扩展到精确连续预测
提出FlowLet框架,结合小波变换和流匹配实现高效可控的3D脑部MRI生成,仅需10步即可生成高质量样本。
强化学习中流策略的测试时梯度引导
👍 3QGF算法:测试时用Critic梯度引导流策略,避免反向传播
从训练配方视角系统研究视觉生成少步蒸馏,构建4步统一生成编辑模型。
用VLM作为判别器的无监督层分解强化学习微调
SITA使用EBM代理似然实现高效分子玻尔兹曼分布采样
自举生成器:基于流匹配的非配对视觉编辑
👍 22无需成对数据,利用预训练模型自举训练流匹配编辑模型
支持1-4说话者的零样本长篇TTS,对话表现力优于开源基线
提出文本引导的激活流匹配模型,通过学习条件速度场实现统一的大语言模型激活干预和分类接口
一种通过潜在空间记忆传播和恢复流匹配实现分钟级稳定人体动画的轻量级后训练框架
递归流匹配通过多尺度轨迹一致性实现1-2步高精度物理仿真。
用Bradley-Terry判别器+前向流匹配,把黑盒视频教师蒸馏进自回归学生。
发现自然图像语义信息集中在方向分量,提出超球面流匹配 SFM。