首个通过MAE在970万页IMSLP乐谱上预训练的ViT基础模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首次系统性研究10种非语言声音的说话人识别,提出条件蒸馏和MoE架构解决领域失配问题
智能体模型的批判性分析与GIC架构
👍 21区分工具型与内禀型系统,提出基于分层目标、演化身份和自调节的GIC架构
单一模型处理任意分辨率的多模态地球观测数据
提出双用途MAE-CNN标记器,同时支持临床预测和可控生成
提出训练自适应的离散化预训练任务,通过特征级粗到细课程提升医学表格数据的自监督学习性能
视频对象中心学习的选择性协同学习
👍 4通过选择性协同学习解决视频对象分解中的编码器-解码器不匹配问题,提升性能并降低计算复杂度
通过软正确性门控和教师概率缩放改进 GUI 定位自蒸馏中的教师信号质量
首个针对扩散LLM的自蒸馏框架,用自生成答案作后缀条件,步级监督提升推理能力
自进化视觉提问者
👍 15让VLM无需外部监督,通过自我迭代学会主动提问并持续进化。
你不需要强假设:通过时序差分学习视觉表征
👍 12TDV用因果性作为唯一弱假设,从视频时序差分中自监督学习视觉表征。
通过神经信任函数评估弱标签可靠性,实现近无损弱到强泛化
通过对比成功与失败的推理轨迹生成可重用insights,提升模型推理效率
自举生成器:基于流匹配的非配对视觉编辑
👍 22无需成对数据,利用预训练模型自举训练流匹配编辑模型
通过在隐空间预测浅层语义表示,正则化表示几何,提升下游任务性能
自监督强化学习训练多模态大模型做在线心智推理,无需心理状态标注
SAVE框架利用RL训练中的在线策略响应实现奖励模型持续自监督改进
统一Transformer架构实现从无约束视频可扩展的自监督新视角合成
几何感知:3D基础先验用于学习语义对应
👍 15利用3D基础先验(SAM3D+PartField)增强2D语义对应,消除左右和重复部件混淆。
几何感知IMU仿真+全身运动token对齐LLM,实现可穿戴运动通用理解。