NUMINA 是一个无需训练的文本到视频框架,通过挑选可分实例的注意力头构造可数布局,引导再生过程,使视频中的物体数量与提示数字精确对齐。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
利用T2I一致风格映射,构建170K风格/400K内容的1.4M风格配对数据集。
用1.13M合成试穿三元组与精确尺寸标签,首次教会VTO模型“衣服合不合身”。
面向可形变物体操作的物理对齐真-仿-真数据合成管线。
用多奖励 Langevin 动力学 + 提示感知自适应策略,在推理时免训练、免反演地引导扩散/流匹配模型
实时单视频驱动的 4D 交互世界模型,24FPS 跑出 SOTA 相机控制。
Sol-RL 用 FP4 探索候选池,BF16 再生成关键样本,加速扩散 RL 4.64×。
首次从 token 空间视角解决深度压缩自编码器的表征坍缩问题
MoRight:做对运动控制
👍 7通过双流架构解耦相机与物体运动,并引入主动-被动因果推理,实现可前向/逆向推理的交互式视频生成。
首个用百万级野外视频原生训练的全身体3D扩散模型
统一框架直接生成人体试穿动画视频,解决身份漂移和服装失真问题
通用多模态蛋白质设计实现化学的DNA编码
👍 31DISCO多模态扩散模型实现蛋白质序列-结构协同设计,无需预定义活性位点即可设计出新酶
提出空间编辑基准+50万条合成数据+16B模型,专攻物体平移/旋转与相机视角控制。
提出解耦运动注入和混合上下文集成,实现高质量组合人-环境视频生成
WAM vs VLA 系统鲁棒性对比研究
提出GateControl框架,通过门控机制在高效线性注意力模型上实现多类型可控图像生成
用合成光流替代合成视频,解耦运动与外观生成高动态视频。
用模块化桥接方案将前馈重建与扩散生成统一为协同框架,从稀疏无位姿图像恢复高保真三维网格。
把FlowEdit速度分解为保真项与引导项,仅缩放引导项即实现稳定滑块控制。
首个动作条件化的第一人称视频世界模型,融合人体姿态联合建模。