提出梯度引导软掩码方法优化LLM用户表示学习,9个工业任务上超越现有方法
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过精确建模模态间隙几何结构,用无配对文本替代昂贵图文数据训练MLLM
首个基于强化学习的混合模态推理框架,显著提升音视频理解能力
基于MLLM的对象嵌入模型,用对象+IoU双token实现精细视觉理解与检索
提出DAIL自蒸馏方法,通过分布对齐和对比学习将专家解法转化为可学习的推理轨迹
通过聚类-对比学习-检索增强生成的三阶段框架,从设计数据中提取风格知识以指导风格化设计改进。
GeoCLIP 以卫星剪裁作地理锚点,以对比学习对齐卫星-地面语义,提高全球图像地理定位精度与泛化能力
K-means聚类构建多样化子表+LLM生成查询+对比微调提升表格检索
构建1亿中文图文对数据集,通过系统化清洗流程显著提升中文视觉-语言预训练性能
通过温度校准、负样本课程和协方差对齐三个轻量模块,将VLM转化为全模态嵌入模型
统一对比学习与3D字幕生成,通过测试时搜索提升跨域鲁棒性
通过对比感知损失增强VLM视觉推理能力的RL微调方法