提出基于MoE的语义感知风格迁移框架,支持从颜色到深层次的多样化风格
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出谱匹配假设,通过ESM和DSM统一提升潜在扩散生成质量
提出跨模态知识转移框架MoKus,通过文本知识更新实现高保真概念定制。
用软标签替代one-hot解决大码本训练困难
提出FIRM框架,通过专门训练的奖励模型和新颖的奖励策略,解决图像编辑与生成中强化学习奖励信号不可靠的问题。
提出ELIT机制,通过可变长度潜在接口实现扩散变换器的弹性计算分配和多预算推理
通过空间稀疏化和动态token激活实现DiT免训练7倍加速
腾讯混元提出压缩通道维度的连续语义表示,打通统一多模态理解与生成。
用不可微奖励强化少步扩散模型,4步生成质量超越80步基线
通过条件引导调度实现混合并行,将扩散模型推理加速2.3倍同时保持图像质量
使用球形编码器的图像生成
👍 21提出球形编码器,通过将图像均匀映射到球面潜在空间,实现单步高质量图像生成。
通过频谱演化感知的缓存策略,在保留内容质量的同时加速扩散模型推理
首个可在手机上实时运行的统一多模态理解与生成模型,仅1.6B参数
统一潜变量(UL):如何训练你的潜变量
👍 62联合训练扩散先验和解码器学习潜变量表示,实现高效生成
提出Nexus适配器,通过跨注意力融合文本与结构,实现高效条件生成
UniT:统一多模态思维链测试时缩放
👍 20通过思维链推理实现统一多模态模型的测试时迭代优化
通过Reason-Reflect-Refine框架将理解嵌入生成过程,解决多模态模型中生成与理解的权衡问题
提出2^128码本的统一离散tokenizer,在理解、生成、编辑任务上均达到SOTA
提出UniDFlow统一框架,用离散流匹配同时实现图像理解、生成和编辑
用动量混合参数化非线性轨迹,2步即可逼近50步教师模型的生成质量