让ECG、PPG、PCG在潜在心脏时间轴上互相监督,一个编码器统一心脏表征
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
面向语言智能的可扩展视觉预训练
👍 55视觉预训练比文本预训练更高效,用25%token预算提升科学推理性能
Vidu S1:实时交互式视频生成模型
👍 134支持语音控制的实时交互式数字人物视频生成系统
通过参数隔离将触觉能力注入小型MLLM,在避免灾难性遗忘的同时实现SOTA触觉推理
视觉即统一多模态生成
👍 45统一多模态生成框架实现异构视觉任务
面向全模态密集视频描述的并行自回归解码
👍 25通过潜在全局规划和事件因子化注意力,实现无损并行自回归视频描述解码
通过大规模数据扩展、动作空间增强和预测动态建模改进VLA模型的实际部署能力
层次化软标签学习用于多模态性别歧视检测
通过注意力机制提取跨模态检索头,实现长文档问答中文本与图像证据的高效定位
DiscoPER通过PROPOSE-EVALUATE-REFLECT循环实现完全自主的多模态科学发现
虎鲸:世界在您心中
👍 312统一世界基础模型,从多模态信号学习世界潜在空间
Act2Answer评估VLA知识保留,发现显著衰减
交错语音语言模型在文本潜空间中工作
👍 13研究发现交错语音语言模型未经转录训练却在中间层隐式地进行语音转录和文本推理
提出ILLUME-X统一模型,实现高质量N-to-M自由形式交错文本-图像生成
通过多轮自适应检索和强化学习优化,显著提升KB-VQA任务的准确率
提出模式引导的MoE框架,让全模态模型学会使用正确的多模态证据进行社交推理
ViQ:任意分辨率的文本对齐视觉量化表示
👍 38ViQ实现高质量量化视觉表示,兼顾语义与细节,支持任意分辨率。
首个零样本同时支持对象计数、人群计数、指代表达计数和精确计数图像生成的统一视觉语言模型
后训练如何塑造生物推理模型
👍 3研究后训练阶段对生物推理模型泛化的不同影响
系统综述多模态代码智能领域,提出以验证为核心的四方向研究议程