首个支持联邦LDM所有权验证和泄露客户端追踪的鲁棒水印框架
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出统一训练框架NANOGEN和综合基准DIFFUSIONBENCH,揭示ImageNet和文本生成图片性能不相关
用于机器人操作的世界价值模型
👍 7将世界模型作为机器人价值学习的基础,实现SOTA任务进度估计
用DA-SLAT、SMDiT、MARoPE解决稀疏体素瓶颈,实现高保真图像到3D生成
通过分层扩散框架实现内容保持的视频编辑,生成编辑层和alpha遮罩与源视频合成
基于点跟踪的视频合成与运动控制
👍 3通过参考图像锚定的点跟踪统一实现视频外观和运动控制
MeshFlow利用等变流匹配在亚秒级内生成高质量三角形网格。
提出双用途MAE-CNN标记器,同时支持临床预测和可控生成
通过挖掘社区LoRA构建大规模数据集,实现高质量的风格-内容双重参考图像生成。
提出两阶段框架,3-5分钟生成单一3D网格,从不同视角呈现不同语义的错觉效果
发现训练随机性比采样随机性更大,FID评估存在1-2%系数变异的噪声底
通过稀疏3D边界框实现精确的多对象视频生成与编辑控制
首个原生面向物理AI的世界模型,跨具身课程+混合线性时序记忆
提出判别器引导的强化学习(DRL),在不依赖人类偏好的情况下修正流匹配模型的分布偏差
Sumi:从头开始的开放均匀扩散语言模型
👍 11首个大规模开源均匀扩散语言模型,7B参数训练1.5T token
首个针对扩散LLM的自蒸馏框架,用自生成答案作后缀条件,步级监督提升推理能力
文本-视觉协同指导的图像编辑
👍 19联合文本语义和视觉空间提示实现精准意图感知的图像编辑
参考引导生成内容超分辨率与精细化
👍 9首次提出RefGC-SR²任务,利用原始高分辨率参考图联合修复生成伪影并提升分辨率。
融合物理渲染与生成先验,实现可控高保真城市场景逆渲染
用双查询记忆机制与主体重建任务约束长视频身份一致性