通过旋转基共享 Lloyd-Max 码本实现数据无关的 DiT 低比特量化,无需校准数据即可跨模态应用
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过估计源图像的光学指纹并迁移到目标设置,实现无需重建全清晰图像的任意散景编辑
通过分布级奖励优化视觉生成模型
👍 16提出分布级奖励框架解决样本级RL的reward hacking问题,显著提升生成质量
基于VLM自动建立文本-视觉对应关系,实现无标注多实例精确可控图像生成
将离散扩散语言模型应用于放射科报告生成,支持任意顺序填充,性能匹配或超越自回归模型且速度更快
Valdi:价值扩散世界模型
👍 15结合扩散模型与价值函数的在线模型预测控制方法
将拒绝样本转化为反馈,实现自适应迭代的多智能体文本图像数据构建
用学习型查询token解决视频世界模型的长期记忆问题
无需训练的高分辨率照片拼图生成框架,通过解耦全局布局和局部瓦片生成实现高效高质量输出
首个零样本无训练无优化的360全景图像视频生成框架
直接消耗地理空间原语的高保真卫星图像生成统一框架
利用清洁潜特征指导路由,解决扩散MoE中的资源分配问题
通过动作条件预训练世界模型,获得可复用的机器人动力学先验
将RLHF和OPD应用于扩散模型,提升图像生成与编辑质量
LISA:视觉条件可控生成的似然分数对齐
👍 13通过显式对齐似然分数加速视觉条件生成模型训练并提升质量
基于扩散Transformer的3D物理运动模拟框架,直接在世界坐标系生成完整网格轨迹
提出物理感知的世界模型EO-WM,实现更可靠的地球观测预测
提出DomainShuttle框架实现高保真且灵活的开放领域视频个性化生成,跨域分数提升18.7%
将视觉规划内化到潜在查询,单前向传播实现结构感知图像生成。
首个相机可控视频虚拟试衣框架,用4D代理实现任意轨迹合成