通过可验证的数据构建解决视觉数学推理中的数据质量和奖励信号可靠性问题
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用DA-SLAT、SMDiT、MARoPE解决稀疏体素瓶颈,实现高保真图像到3D生成
提出智能体数据裁剪框架,将高熵原始多模态流转换为意图对齐的结构化训练数据
首个统一分子与蛋白质的多模态生物基础模型,原生支持序列、结构和语言
单一模型处理任意分辨率的多模态地球观测数据
首个用RL指导演示检索的模仿学习方法,无需重训练即可处理摄像头丢失,在LIBERO基准上大幅领先基线
通过分离感知和推理阶段的教师监督,解决多模态自蒸馏中的答案捷径问题
文本-视觉协同指导的图像编辑
👍 19联合文本语义和视觉空间提示实现精准意图感知的图像编辑
单一离散视觉 token 实现理解生成统一的自回归框架
提出基于统一科学语法的多领域生成框架LOGOS,实现蛋白质、小分子、材料等科学任务的统一序列建模
提出双流频率标记器和MotionVLA框架,解决人形运动生成中姿态语义与物理动态的频域不匹配问题
用大语言模型对齐量子算子
👍 4首次将量子酉算子直接映射到LLM潜在空间,实现量子电路综合与语言条件化控制
通过解耦语义外观与几何结构实现编辑后视频长期一致性
从冻结扩散Transformer提取多模态感知信息
首个在单个ViT中统一图像视频tokenization的UMM框架
提出Actor-Critic框架和ArogyaBodha数据集,解决7种印度语言医疗推理问题
统一的8B参数具身基础模型,整合认知、规划和定位能力,实现SOTA性能
用统一离散视觉token实现图像理解、生成和编辑的自回归模型
提出Latent Memory,将每条多模态证据压缩为一个高维潜在token,实现高效的问答系统
基于AGM信念修订的结构思维框架解决跨模态冲突