利用大规模图像编辑模型的强先验知识,通过高质量数据生成与两阶段训练实现真实世界图像复原
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出基于ControlNet的两阶段伪装攻击框架,生成既欺骗检测器又对人类隐蔽的车辆伪装图案
用字形引导SFT+多目标RL解决图像内文字编辑难题,330K数据+15语言基准
提出FIRM框架,通过专门训练的奖励模型和新颖的奖励策略,解决图像编辑与生成中强化学习奖励信号不可靠的问题。
首个评估图像编辑模型学科推理能力的基准,揭示当前模型在知识密集型编辑中的巨大瓶颈
腾讯混元提出压缩通道维度的连续语义表示,打通统一多模态理解与生成。
用可执行代码作为思维链中间表示,实现精确可控的文生图生成
用动态路由将编辑任务分发给异构专家,解决多条件图像编辑中的信号冲突问题
用工具式代理+链式推理替代直接提示,训练小型VLM规划器提升复杂图像编辑质量
从规模到速度:图像编辑的自适应测试时缩放
👍 138ADE-CoT通过难度感知分配、编辑验证和自适应停止,实现2倍加速
首个针对小尺度物体编辑的基准,揭示现有模型在精细定位和编辑上的严重不足
将图像编辑重新定义为物理状态转移,利用视频监督学习物理先验,提升编辑的物理合理性。
ArtiAgent智能体框架自动合成图像伪影数据,训练VLM超越GPT-5的伪影理解能力
用 LoRA 权重基底跨越视觉类比空间
👍 13提出 LoRWeB,通过可学习的 LoRA 基底和动态编码器组合,实现对未见视觉类比任务的泛化编辑。
UniT:统一多模态思维链测试时缩放
👍 20通过思维链推理实现统一多模态模型的测试时迭代优化
小红书团队通过系统优化数据工程与训练方法,实现开源SOTA指令图像编辑
提出统一后训练框架,通过SFT与多任务RL结合,大幅提升多模态扩散语言模型的推理能力
提出UniDFlow统一框架,用离散流匹配同时实现图像理解、生成和编辑
5B参数统一模型,性能超越80B基线,核心为堆叠通道桥接架构
首个纯视觉输入的图像编辑模型越狱攻击方法,配合安全基准与防御方案