开源模块化研究栈把世界-动作模型预训练变成受控实验,提炼三大准则并开源6400小时数据预训练模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
7B 开源原生音视频联合生成模型:门控跨模态注意力+多模态 RL+一步 2K 精修
用3D补丁记忆与分块相机注意力统一长时记忆与相机控制,实现720p实时交互世界生成
可微分令牌取舍机制让视频 VAE 按内容复杂度自适应压缩,生成更快更省
生成式语义场景补全
👍 2一套离散扩散框架身兼三职:合成配对数据、从噪声补全、一步修正冻结模型,达38.8% mIoU
用学生自身SDE分支探索替代教师目标,免教师实现流匹配模型的密集逐步蒸馏对齐
首个统一生成未来画面与键鼠动作的游戏世界动作模型,并发现LASI失效模式
把未来想象压缩为潜在动作意图序列,性能追平 Joint-WAM 且延迟降低 42.9%
补丁重参数化让冻结语义ViT兼得理解与重建,单一视觉空间支撑生成与编辑
四阶段渐进因果训练将双向生成器蒸馏为1/2/4步世界模型,支持草稿重放精修
能量引导的流匹配
👍 11用随图像频谱演化的移动低通终点替换固定终点,让像素级流匹配按粗到细轨迹生成
Abra:扩散图像训练的规模化定律研究
👍 10扩散文生图模型需约200图像token/参数才达计算最优,是LLM的10倍,且过训练几乎无代价。
免拟合将预优化3DGS转为稀疏体素潜变量,单张卫星图生成千米级航拍3D场景
免VAE像素扩散Transformer统一修复八种图像退化,单步推理仅44ms
像素空间文生图扩散模型训练的实证研究
👍 31潜空间预训练再迁移像素空间后训练的实证配方,质量持平潜空间模型且推理快3.18–4.75倍
视频生成仅作训练信号,推理时丢弃视频分支直接预测轨迹
用未来预测学共享动力学先验,MoE动作头生成各本体原生动作,单一检查点跨三类机器人
仅对翻译任务启用流匹配、其余任务按语义路由对比目标,配三阶段课程实现多语言嵌入均衡适配
用像素桥接与可切换适配器把异构教师能力蒸馏进单一学生
生物启发框架,同时生成分子胶并组装三元复合物。