提出3D-Fit基准,评测LLM在多重3D空间约束下的分子生成能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
免训练框架,借历史预测构造卡尔曼式时序共识校正扩散采样,零额外 NFE。
纯扩散端到端模型,单次生成5分钟多语种歌曲并直接分离人声与伴奏双轨
首个MeanFlow前向过程强化学习,用诱导瞬时速度预测器优化平均速度生成器。
结合隐式几何先验与尺度感知RoPE,实现大视角变化的精确可控单目新视角合成
视频生成模型是通用视觉学习器
👍 78利用预训练视频生成模型构建统一通用的多任务视觉感知框架
通过生成大量廉价草稿候选并进行多阶段筛选,实现扩散模型在固定墙钟时间预算下的高效推理扩展
首个开源MoE视频基础模型,通过稀疏专家架构、机器人增强数据和多维奖励系统实现物理世界的精确模拟。
OPSD-V通过真实长视频上下文进行缓存感知的在线策略自蒸馏,提升少步自回归视频生成的长视距稳定性
融合LLM规划器和VLM批评者,将视频生成器转化为任务感知的世界模型,显著提升长周期机器人操作性能
同步生成RGB、深度和光流的4D世界模型,实现高精度机器人操作
基于像素空间扩散的单目3D点图预测方法,无需VAE,边界更锐利
统一双向与自回归视频生成的灵活分块框架,实现质量与效率的动态权衡
提出三模式LM,联合AR和扩散训练,实现AR/扩散/自投机三种解码方式,在精度和速度上超越SOTA开源模型
首个无需预设相机轨迹的户外3D场景生成框架,自动调度视图并提供对象级外观和几何控制
Bridge模块解决跨空间蒸馏,让SD 1.5从现代教师学习高质量生成
基于表示自编码器的多人交互世界模型
👍 22首个支持四玩家实时交互的动态环境世界模型,在单张GPU上实现20fps生成且能保持数小时稳定
dOPSD:扩散语言模型在策略自蒸馏方法
👍 16从扩散解码轨迹中自生成特权信息,实现dLLM的有效在策略自蒸馏
通过4D几何先验和时空自强迫机制实现任意长度的多视角视频生成
两阶段框架生成全局一致的大规模3D场景,先创建2D模板再转换为3D高斯点云