提出基于时间距离的自适应KV缓存压缩方法,在固定预算下实现长视频的一致性生成
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
将视频世界模型从相机导航扩展到对象级轨迹控制,实现相机与对象操作的组合控制
dots.tts 技术报告
👍 16首个20亿参数的连续自回归TTS基础模型,解决长序列误差累积问题,达到开源SOTA性能
用可学习的演化记忆查询实现实时无限长视频生成。
用双向判别器与分布匹配预热实现单步自回归视频生成,解决运动坍缩与训练不稳定。
用自适应状态替换静态锚点,解决流式视频生成中的动态性抑制问题
把VQ量化轴改为通道维度,实现100%码本利用率与next-channel AR生成。
实时交互式人体服装视频定制,23.8 FPS 单卡推理
RAVEN 通过重打包自展开轨迹并结合一致性模型策略优化,实现高质量实时自回归视频生成。
用于视觉合成的生成式细化网络(GRN)
👍 15HBQ近无损离散token+可擦除全局细化AR,2B刷新多任务SOTA
使用自回归Transformer逐点生成3D高斯点云,实现从单张图像生成可驱动的4D头像
提出SC-DMD与缓存感知训练,解决视频扩散蒸馏多步组合崩溃与缓存漂移
统一语义空间表示所有模态,支持交织跨模态推理
提出UMF框架,通过P-Flow和S-Flow实现任意人数的文本生成动作
AutoGaze:3M参数前置模块裁剪冗余patch,实现19×加速
通过在自回归序列中显式生成分割和深度token增强VLM空间推理
提出带 MeanFlow 解码器的 1D 因果图像分词器,平衡令牌因果性与解码效率。
首个直接在网格空间自回归做单视图场景重建的框架,一次前向同时预测物体位姿与几何。
首个时空自回归扩散模型,从透视视频原生生成4K分辨率360°全景视频
首个在线因果框架,用于生成与实时对话同步的全身手势和面部表情。