开源五阶段视频数据流水线,对照实验证明广覆盖配方的早期预训练效果优于高过滤配方
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
因果Transformer预测下一音频补丁嵌入,仅凭掩码加停梯度实现极简SOTA音频自监督
让ECG、PPG、PCG在潜在心脏时间轴上互相监督,一个编码器统一心脏表征
反转师生不对称方向:教师看原图、学生看增强退化视图,用视图落差当免费蒸馏信号
BagNet+t-SimCNE,打造天生可解释的眼底图像基础模型
用图表-表格-代码三表征一致性作为自监督信号协同优化多模态跨表征理解
用层次化JEPA编码器与像素空间流匹配,打造CPU实时可运行的音乐协作智能体
每个机器人仅凭局部观测与256字节消息预测同一未来集群状态。
PhiZero:围绕物理语言构建的物理世界模型
👍 166从野外视频自监督学习离散'物理语言',先推理后渲染的物理世界模型。
自适应多教师蒸馏框架,用单类SVM加权与关系相似矩阵损失压缩语音情感模型到边缘设备
从视频中自监督学习结构化动态表示
👍 18在冻结图像骨干特征上学习主/残差结构化运动 token,自监督分离相机与物体动态
用簇级数据平衡预训练和域感知采样微调,为中亚低资源语言构建ASR基础模型
面向语言智能的可扩展视觉预训练
👍 55视觉预训练比文本预训练更高效,用25%token预算提升科学推理性能
利用自监督语音模型的音韵特征向量,无需梯度下降即可实现音素分割和识别
395次实验揭示地球观测模型缩放规律,蒸馏出高效嵌入产品
提出SiamJEPA,首次系统揭示JEPA中孪生学生编码器作为有效正则化器,提升表示质量并加速收敛。
面向密集空间感知的视觉预训练
👍 42提出边界中心的自监督视觉预训练框架,通过强制掩码边界建模实现强空间理解能力
提出DEPOOL基准,揭示时间聚合方法对backbone和随机种子的敏感性
面向音节切分的说话人解耦分块回归
👍 3通过说话者解耦的分块回归实现高质量音节标记化,提升语音语言模型性能
用任务无关预训练解锁物理常识,减少VLA对专家数据的依赖