8B-MoT 无编码器无VAE统一模型,靠空间联合重建与多专家RL蒸馏兼顾理解、生成与编辑
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出多轮图表精修基准与多智能体系统,破解质量漂移与遗忘两大失败模式
以概念规模化与密集监督释放图像编辑的潜力
👍 50用千级细粒度概念库与组合式密集监督,刷新图像编辑SOTA并压缩训练样本需求1.5倍。
补丁重参数化让冻结语义ViT兼得理解与重建,单一视觉空间支撑生成与编辑
扩散桥加先验引导稀疏注意力,让图像编辑忠实高效地冲上4K
从通用编辑、真实部署到推理编辑三维覆盖,与人类偏好最对齐的图像编辑评测基准
三阶段框架让图像编辑对话中的后续建议既契合用户偏好又与当前画面视觉一致
提出EVR奖励:多假设评估+视觉验证,强化学习优化多参考图像编辑。
用冻结3D人体网格重建量化多人交互编辑的解剖与接触几何,揭示VLM裁判的饱和盲区
面向视频模型的视觉提示工程
👍 19用图像编辑模型改造任务图片,系统提升视频模型视觉推理能力
4B 紧凑栈协同设计 tokenizer、骨干与系统,达成原生分辨率文生图与指令编辑的高效折中。
用紧凑指针 token 把图文条件精确路由到 DiT 的指定空间区域
首个让文本与图像在同一步内互相纠正的并发扩散采样器
用208M图、约40万美元训出的开源多模态生成系统,靠'理解优先'追平闭源。
用大模型检测并投票纠正3D/4D生成中的时空幻觉,无需重训
让 RGB 成为视觉的通用语言
👍 13用RGB统一视觉任务的输入输出,冻结图像编辑器零样本完成25项感知与生成任务
基于视觉实例提示分割的可控虚拟试衣
👍 10把虚拟试衣转为图像编辑任务,用手绘掩码精确控制衣物尺寸、款式与摆放
CanvasAgent协调11种视觉工具实现复杂图像创建与编辑。
通过估计源图像的光学指纹并迁移到目标设置,实现无需重建全清晰图像的任意散景编辑
提出基于示例的人像结构精修框架,通过自增强范式和4700万对数据集实现精确操作传递