自适应长度离散部件令牌+长上下文自回归,部件级3D生成扩展至300部件、256k令牌
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用因果教师与前缀评分对齐师生信息集,实现低延迟可控长视频生成
OPSD-V通过真实长视频上下文进行缓存感知的在线策略自蒸馏,提升少步自回归视频生成的长视距稳定性
面向全模态密集视频描述的并行自回归解码
👍 25通过潜在全局规划和事件因子化注意力,实现无损并行自回归视频描述解码
系统研究世界模型作为机器人策略评估器的关键设计要素,提出GigaWorld-1实现14.9%性能提升
GEAR:引导式端到端自回归图像合成
👍 34端到端联合训练VQ tokenizer和AR generator,将ImageNet训练加速10倍
统一TF-CM和SF-DMD的三阶段蒸馏,1-4步实时流式视频生成达84.63分。
通过三类训练时数据增强解决数据重复导致的过拟合问题,使固定数据集上多轮训练变得有效
首个单GPU实时运行22B参数的视听自回归生成模型,支持亚秒级交互和千秒级长时生成
单一离散视觉 token 实现理解生成统一的自回归框架
提出无标签对抗框架BadWorld,攻击自回归世界模型速度场暴露其脆弱性
用统一离散视觉token实现图像理解、生成和编辑的自回归模型
通过稀疏体素引导的自回归框架,将网格生成视为表面编织过程,实现高压缩比和高质量的3D网格生成
通过检索历史生成内容解决AR长视频生成的错误累积问题
提出SwanSphere框架,实现全景视频和文本提示驱动的高保真空间音频流式生成
通过联合DMD和对抗损失实现高质量单步自回归视频生成
用Bradley-Terry判别器+前向流匹配,把黑盒视频教师蒸馏进自回归学生。
通过协同进化策略与解码器解决离散AR T2I模型中的潜在协变量偏移问题
KVPO:面向流式自回归视频生成,在ODE原生范式下做KV语义探索的偏好对齐
提出层级化 SVG 分词框架,将命令-参数组压缩为可渲染片段标记,序列长度缩减 63%。