以最后可用真值为跨尺度参考约束递归超分训练,无真值深尺度幻觉降低2–5倍且质量达SOTA
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用手持夹爪采集手-爪配对数据,两阶段扩散框架实现复杂空间操作迁移
把多镜头叙事从时间轴搬进空间网格,联合生成长视频
熵正则防坍缩、先生成后重构的调度,首次实现VAE与生成模型的稳定端到端联训
环形数据构造强制模型检索远期历史,实现分钟级长视频与客体永久性
27任务810实例的过程敏感基准:最强视频模型Seedance 2.0推理也仅51.0分
以概念规模化与密集监督释放图像编辑的潜力
👍 50用千级细粒度概念库与组合式密集监督,刷新图像编辑SOTA并压缩训练样本需求1.5倍。
冻结流式生成器,适配器在编辑到达时点火,无限轮指令编辑质量不衰减
以像素级动作流为共享接口,统一跨本体世界建模、开环策略评估与逆向机器人控制
首个系统评估音乐编辑系统非目标属性保持能力的四维度指标框架MuseCPEval
V-RAE:为生成重新思考视频潜在空间
👍 29以冻结视觉基础模型特征构建语义潜空间,视频重建与生成双优、收敛快至6倍
Abra:扩散图像训练的规模化定律研究
👍 10扩散文生图模型需约200图像token/参数才达计算最优,是LLM的10倍,且过训练几乎无代价。
免VAE像素扩散Transformer统一修复八种图像退化,单步推理仅44ms
像素空间文生图扩散模型训练的实证研究
👍 31潜空间预训练再迁移像素空间后训练的实证配方,质量持平潜空间模型且推理快3.18–4.75倍
SE(3) 几何感知的动作条件视频世界模型,登顶 WorldArena 2.0 预测赛道
潜空间SDS伪影源于VAE欠约束的像素漂移,解码前瞻步即可轻量修复梯度
首个视频去反射闭环框架:物理增强合成配对数据、一步扩散去除模型与专用基准S2R-Bench
用对抗学习的动态表征补足静态Fréchet目标盲区,抑制Fréchet hacking
让全模态对话模型不仅开口说话,还能以参考形象生成口型同步的视频回应
用方向标志训练单一双向扩散模型,以前后往返的不一致自监督估计展开误差。