多智能体分层框架实现4K原生分辨率高保真多轮图像编辑
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
统一推理框架,通过世界知识增强与视觉精修实现高质量图像生成与编辑
首个评估视觉指令(草图/箭头)驱动图像编辑能力的分层基准,揭示现有模型在因果推理上的瓶颈
构建5000查询15子类的CIR细粒度基准EDIR,揭示现有模型在纹理、否定等能力上的显著不足
VIBE:基于视觉指令的图像编辑器
👍 64紧凑高效的指令式图像编辑系统,2B VLM+1.6B扩散模型,4秒生成2K图像
基于扩散模型,通过VNE和宽松训练目标编辑物体内在属性。
通过层次化任务语义注入MoE路由,解决统一图像生成编辑中的任务干扰问题
基于VLM与扩散模型的统一框架,通过自然语言指令实现多语言视觉文本生成与编辑。
提出IC-CoT结构化推理和GRPO对齐训练,提升多参考图像的生成与编辑能力
提出将推理与生成解耦的RL框架,通过CoT采样和检查表奖励提升推理驱动图像编辑性能
单一框架统一图像视频生成编辑的多模态扩散模型
首个RL框架实现文本指导物体平移、旋转、缩放