统一模型实现多镜头视频生成、参考生成与编辑,单GPU达16.74FPS。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个支持用户与世界内角色进行社交互动的视频世界模型
用像素桥接与可切换适配器把异构教师能力蒸馏进单一学生
轻量可复现的流式视频世界模型框架,单机8卡数日即可从零训练
用抽象运动视图自举跨类别配对,再内化为端到端视频运动迁移。
可复现的指定-渲染-检查流水线构建 9401 张人物图像数据集 Poplar-9K
视觉生成中文本条件化的缩放特性
👍 37信息量而非长度才是文本-图像的缩放轴:结构化提示预测扩散损失
PhiZero:围绕物理语言构建的物理世界模型
👍 166从野外视频自监督学习离散'物理语言',先推理后渲染的物理世界模型。
用可执行 Blender 代码充当过程级思维链,双引擎系统生成物理一致视频。
训练时探索K个候选并训练最优者,为生成模型新增缩放轴并实现端到端生成
提出TriLayer三元组数据集与双分支扩散框架,实现视频物体的显式分层插入与分解。
把试穿重新定义成多参考理解驱动生成,靠数据引擎+CPT-SFT-RL达到任意品类SOTA
将组合生成建模为内在奖励对齐,导出闭式倾斜分布与原则性扩散引导
用频谱先验降低扩散模型的曝光偏差
👍 6推理时用FFT频谱对齐校正扩散模型曝光偏差,开销仅3-4%
用持久的世界状态寄存器让多智能体视频世界模型保持跨视角一致性
用可编辑的有向交互图取代轨迹控制,冻结视频DiT加LoRA实现多物体可控生成
受控合成测试床揭示:数据均衡与字幕精确率主导T2V生成上限
Chat模板token是DiT的隐式语义寄存器:语义走S→I→R间接回路,据此剪枝省20%注意力算力
用紧凑指针 token 把图文条件精确路由到 DiT 的指定空间区域
用像素对扭曲流场从图像编辑样本实时生成视频编辑训练数据