两阶段训练的多模态嵌入家族:2B 超越 8B 基线,9B 以 80.6 分居 MMEB-v2 榜首
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
LAION 发布 1000 万小时开放视频数据集,一源三用验证视频、音频、图文预训练
抖音多模态嵌入模型技术报告
👍 14两阶段训练兼顾十亿级检索效率与细粒度语义判别
FATE:帧级音视频时序嵌入
👍 5保留帧级特征的双编码器嵌入模型,单一相似度同时刻画语义与时间对齐
用物理约束的可解释解码器揭示 MEG 语音检索背后的皮层源与刺激特征。
仅对翻译任务启用流匹配、其余任务按语义路由对比目标,配三阶段课程实现多语言嵌入均衡适配
联合训练音视频VAE,用对比学习与语义蒸馏实现跨模态对齐,提升联合生成质量。
视觉对比自蒸馏
👍 48用原图与擦除图像的预测对比构造自蒸馏目标,无需外部教师或答案提示。
用参考答案引导的对比概率差作为token级正确性信号来塑形RLVR优势
自然图像对比学习的一种理论
👍 15解析证明对比学习最优表示是测部分频率并做白化,可用正弦滤波器单层CNN实现。
用预训练MLM头实现低资源多语言立场检测
零污染记忆库提升DINOv2半监督分割
通过头级拓扑对齐提升MLLMs视觉感知能力
无需文本标注答案,通过对比正负视觉证据门控提升细粒度视觉推理能力
d-Simplex平稳表示蕴含兼容性,HOC损失实现SOTA兼容学习
通过树结构rollout和对比探索提升智能体RLVR的样本效率
提出Latent Memory,将每条多模态证据压缩为一个高维潜在token,实现高效的问答系统
通过对比成功与失败的推理轨迹生成可重用insights,提升模型推理效率
提出训练无关的诊断方法评估密集检索硬负样本源质量
首个在BRep原语上直接进行多模态对比预训练的CAD理解框架