构建百万小时人类视频语料,验证替代机器人数据的可行性
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
大模型时代的音视觉智能:一项综合性综述
👍 35首篇系统综述大模型时代音视觉感知/生成/交互三大支柱的统一分类法与方法论
聚焦物理推理本身,25个仿真环境+13基线评估TAMP/RL/IL/FM
首个高保真无人机具身搜救基准与仿真平台。
首个统一评估交互式世界模型的基准,提出动作生成框架,跨4.9K任务对14个模型做九维评测。
用第三人称视频生成作为中间表征,把任务指令转化为可执行的人形机器人行为,无需任务专属数据采集。
用3D语义占据把真实场景搬进Minecraft,并配套大规模数据集和VLN导航验证
X-WAM:统一4D世界动作模型,联合预测多视角RGB-D视频与机器人动作
首篇VLA模型安全性综述:以训练时/推理时双时间轴统一梳理攻击、防御、评估与部署
面向3D具身智能体的免训练推理时幻觉缓解框架
面向多智能体多视角的可扩展视频世界建模框架
提出LARYBench基准,评估潜在动作表示在语义理解和机器人控制两个维度上的能力
提出Seeing Through Touch框架,用局部视觉-触觉对齐实现触觉引导的材料分割。
腾讯混元具身基础模型家族,MoT+自进化训练+蒸馏,2B 小模型 SOTA 22 基准。
开源 3D 框中心化的空间数据引擎,合成 3M 多任务样本让 VLM 在空间推理基准上平均提升 14.1%。
用预训练视频扩散器当价值模型,联合预测未来本体状态与价值,突破VLM在长程任务中的时序建模瓶颈。
基于宝可梦Z-A的3D长视距VLM基准,揭示当前视觉语言模型的物理死锁恢复瓶颈。
把7自由度机器人动作编码成像素级动作图像,让视频主干直接当零样本策略
首个将三维点云作为可更新世界状态、闭环驱动自我中心手物交互视频生成的模拟器。
首个动作条件化的第一人称视频世界模型,融合人体姿态联合建模。