熵正则防坍缩、先生成后重构的调度,首次实现VAE与生成模型的稳定端到端联训
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
环形数据构造强制模型检索远期历史,实现分钟级长视频与客体永久性
把3D形状码的逐token自回归解码改为块间因果、块内并行去噪加置信度修正,提速5.15倍
Alaya-EVOKE:从线性开销监督到无尽世界
👍 130外置相机位姿索引的几何记忆,配合长时程教师蒸馏,实现三步生成、小时级不间断的交互世界模型
轻量可复现的流式视频世界模型框架,单机8卡数日即可从零训练
Wonder:打造更优的视频世界模型
👍 19实时相机可控的视频世界模型,支持图像与视频条件的长程交互探索
基于15B扩散Transformer的交互式长时程世界模型,蒸馏至4步实现低延迟生成
38B统一具身合成模型,兼做世界模型与机器人数据引擎
统一双向与自回归视频生成的灵活分块框架,实现质量与效率的动态权衡
系统刻画MLLM生成时逐token注意力动态,并用注意力阻断与增强干预验证因果并提升性能
通过4D几何先验和时空自强迫机制实现任意长度的多视角视频生成
首个用单一自回归 Transformer 统一脑-视觉-语言四任务的大脑模型
首次实现支持自回归生成的哈希框架,突破词汇表瓶颈,性能优于标准Transformer
低维中间状态+并行rollout近似,刷新像素空间AR生成SOTA
通过稀疏自适应体素结构实现163倍分辨率提升的3D力学属性场预测
提出双流频率标记器和MotionVLA框架,解决人形运动生成中姿态语义与物理动态的频域不匹配问题
支持相机导航、场景记忆和可组合事件控制的通用世界模型
用双注意力池+周期性KV刷新解锁多分钟级自然视频流的稳定-运动权衡。
CPPO通过位置加权阈值和累积前缀预算解决LLM强化学习中自回归生成的不对称性
首个支持实时推理的唇形同步扩散模型,通过分析驱动的蒸馏框架将14B教师压缩为两步自回归学生,实现31 FPS流式生成