在固定 VAE 潜空间中,对比直接预测干净潜码与速度预测的差距。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
把注意力矩阵拆成对称与反对称两部分,用 Hopfield 能量视角诊断并用「循环扰动」控制扩散模型的保真度-多样性权衡。
提出DLA模块和多阶段去噪策略,整合MLLM与VAE实现高质量主题驱动图像生成
首个20B参数统一框架支持文本/图像/图层生成多层可编辑设计
用显式 3D 缓存解耦几何与纹理,让扩散模型沿任意相机轨迹生成时空一致的 360° 视频。
Retinex 插值连续伪配对 + 边缘加权 Flow Matching,实现可控低光增强。
Helix4D:复杂动态 4D 网格生成
👍 14将图像生成3D的Trellis2扩展为视频驱动的4D动态网格生成
用干预式基准诊断视频生成模型是否真正理解物理规律。
用Sobolev空间着色噪声先验+对抗负样本生成,弥合扩散SR与自然图像频谱差距。
用VLM推理补全稀疏轨迹,生成符合物理常识的视频。
首个无需训练即可实现文本-图像双条件引导的扩散模型方法
Lens: 重新思考基础文生图模型的训练效率
👍 1113.8B参数文生图模型,仅用Z-Image约19.3%算力即可在多个基准上追平甚至超越6B+模型。
PiD把潜变量解码重定义为像素扩散,统一解码与超分,4步蒸馏即可秒级生成4K图像。
SCOPE 用按像素时序条件化把 FPS 动作的局部分析与全局稳定解耦
用生成式3D先验以分块条件生成方式重建高保真PBR网格场景
ETCHR:用编辑来澄清和驾驭视觉推理
👍 13用专用图像编辑器替代工具调用与统一多模态,让MLLM真正“用图像思考”。
训练无关的推理时框架,用Tweedie匹配对齐重叠窗口,生成长视频且无需微调
用4DGS构造配对数据,训练扩散模型将单体dashcam视频转换为多相机+LiDAR的AV日志
用MLLM在自身ViT嵌入空间做语义规划,解耦理解与扩散渲染,统一视频生成与编辑。
通过KV缓存和ARC-Forcing改造扩散模型,实现消费级硬件上的实时音乐生成