通过参数化Lottie tokens和多模态指令,实现高质量矢量动画的自动生成。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
单个多模态LLM直接从文本或图像生成可编辑矢量字形
用二值扩散头替换 softmax,大幅扩展词表并行生成
用最优传输理论修正自回归扩散模型中的条件误差,在ImageNet上达到SOTA
用RL后训练大幅提升视频世界模型的动作跟随精度和视觉质量
提出可动态切换文本/视觉/交错三种推理模式的混合自回归多模态推理模型
首个万亿参数级统一多模态自回归模型,支持文本、图像、视频、音频的理解与生成
用离散Token统一表示蒙皮权重,实现骨骼生成与蒙皮预测的端到端自回归绑定
LIVE:长时域交互式视频世界建模
👍 13通过循环一致性目标约束误差累积,实现稳定长时域视频生成
面向机器人控制的因果世界建模
👍 32提出LingBot-VA自回归扩散框架,统一视频动态预测与动作推理实现闭环机器人操控
提出VLUAS范式,将视觉信号从被动输入转变为生成目标,实现标准VLM统一处理多模态和视觉任务
首个无需扩散解码器的统一自回归多模态模型,支持文本、图像、语音的任意到任意生成
通过靶向约20%高熵token实现高效视觉-语言模型对抗攻击
首个引入时空记忆机制的相机控制视频重渲染框架,实现多视图场景的一致性生成
在 1D 视觉 tokenizer 中引入层次残差设计,显著提升 AR 图像生成效率和质量
统一自回归Transformer通过next-scale预测实现高效多模态理解与生成