提出解耦世界演化与渲染的框架,让视野外实体持续演化
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
把模型适配从单一参数点覆写转向按实例条件生成LoRA算子,实现函数式神经记忆
用变分框架联合训练噪声适配器与流映射,让 Flow Map 在一步生成中实现条件采样。
免训练激活引导生成配对内窥镜反事实图像
大规模人体数据集+非对称注意力,实现跨视角身份一致视频生成
通过学习路由的动态分块机制替换固定patch化,实现扩散变换器的自适应计算分配
物理模拟器在环视频生成
👍 12将物理模拟器嵌入视频生成循环,确保运动符合物理规律
基于曲率的异构 token 缓存框架,实现扩散世界模型最高 3.7 倍加速且保持 98% 生成质量
提出iFID指标,用最近邻潜在插值替代直接重建,与扩散gFID相关性达0.85
基于参考图的高保真修复框架,通过高频增强注意力和细节感知损失生成人-商品图像
通过联合建模多源世界知识(运动、语义、几何),实现物理一致的视频生成。
Helios:真正的实时长视频生成模型
👍 190首个在单H100上以19.5 FPS运行的14B视频生成模型,支持分钟级长视频
首个时空自回归扩散模型,从透视视频原生生成4K分辨率360°全景视频
构建开源数据集RefVIE及统一模型Kiwi-Edit,实现参考引导视频编辑
提出稀疏控制+密集合成双分支架构,无需配对数据即可完成局部视频编辑
把 CFG 重写为控制律,提出滑模控制 SMC-CFG 解决高引导尺度下的振荡失稳
用 Masking Warmup 把 CLIP 对比学习与文生图生成在单阶段端到端模型中真正统一,并带来推理时自导向的语义对齐解码。
用非线性MLP传输映射+几何条件门控,解决T2I激活引导的安全-质量权衡
从规模到速度:图像编辑的自适应测试时缩放
👍 138ADE-CoT通过难度感知分配、编辑验证和自适应停止,实现2倍加速
基于混合扩散框架的统一多模态模型,解耦离散/连续扩散实现理解与生成