用递归贝叶斯信念更新为长程智能体RL做回合级信用分配
Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Jie Wu, Zhengzhou Cai,...
GRPO
强化学习信用分配
智能体RL
自蒸馏
贝叶斯信念更新
跨平台 CUA 轨迹评测基准揭示 VLM 判官普遍的宽容偏差,并开源低成本奖励模型弥合成本鸿沟。
Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen,...
VLM 判官
奖励模型
强化学习
计算机使用智能体
评测基准
用物理约束的可解释解码器揭示 MEG 语音检索背后的皮层源与刺激特征。
Ilia Semenkov, Daria Kleeva, Ivan Dakhtin, Zarina Maksudova, Alex Ossadtchi
MEG解码
可解释深度学习
对比学习
源定位
脑机接口
用粗到细的智能体管线,从开放文本生成可探索、可编辑的大规模三维世界
Chunchao Guo, Jinpeng Li, Yang Li, Zilong Huang
3D场景生成
Tencent Hunyuan
图像到3D重建
地形生成
开放世界
视频全局空间感知基准,揭示最强VLM仍落后人类36分,定向训练可大幅缩小差距。
Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie...
VQA
具身智能
基准测试
空间智能
视觉语言模型
让单一策略同时扮演行动者与环境,内化世界模型以摆脱外部环境依赖。
Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang...
LLM Agent
Test-time Scaling
世界模型
工具调用
强化学习
让推理器从初始检索的失败中学习,生成定向思维链自适应重排或重检索。
Zelong Sun, Jun Wang, Kaicheng Yang, Tiancheng Gu, Ziyong Feng, Zhiwu Lu
多模态检索
嵌入模型
强化学习
思维链
硬负样本
用潜在视觉状态重构与隐式过程奖励强化学习,让多模态大模型掌握时序视觉推理。
Yifan Shen, Jian Xu, Boyi Li, Yuner Zhang, Tianjiao Yu, Bingxuan Li, Houze...
GRPO
多模态大模型
强化学习
时序推理
潜在表示学习
为经济世界模型提出六级能力阶梯与可复用模块化实现协议
Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha,...
LLM智能体
多智能体模拟
强化学习环境
文献综述
系统蓝图
首个衡量 LLM 在固定预算下迭代优化智能体线束的基准,揭示了模型差异大于工具差异
Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath,...
代码智能体
前沿模型评估
基准评测
智能体线束优化
自动化研究
将OPD2蒸馏扩展至英/韩/日数学推理,揭示推理迁移与语言保留的差异。
Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
LLM后训练
Qwen3
在线策略蒸馏
多语言推理
数学推理
要求完整表格输出并用确定性评测衡量数据智能体在跨语言异构工作空间表现的基准。
Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu,...
Text-to-SQL
基准测试
多模态分析
异构工作空间
数据智能体
端到端适配 Nemotron 到希腊语专业域,1B 嵌入微调+LoRA 读者大幅超越通用多语言栈。
Ayoub Kirouane, Christos Petrocheilos
BM25
LoRA
RAG评估基准
多语言检索
嵌入模型微调
KVAE 系列分词器覆盖音频、图像、视频三模态,重建与生成质量均匹配或超越主流开源方案
Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill...
VAE
audio generation
latent diffusion
multimodal generation
tokenizer
任务条件化的腕部未来潜在预测,让VLA获得细粒度操作能力
Yuhao Pan, Haosong Peng, Zhengshen Zhang, Zhengyang Yan, Yalun Dai, Fushuo...
未来预测建模
机器人操作
腕部观测
视觉-语言-动作模型
链式思维监督
让多模态大模型按问题语义动态挑选3D模态并分配专家
Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan
3D场景理解
多模态大模型
模态自适应路由
混合专家MoE
视觉语言模型
用确定性零模型流水线把屏幕活动编译成可审计、可缓存、零成本的智能体情景记忆。
Nossa Iyamu
MCP
例程回放
屏幕活动捕获
情景记忆
智能体成本
用未来预测学共享动力学先验,MoE动作头生成各本体原生动作,单一检查点跨三类机器人
Junfeng Li, Junjie He, Zhide Zhong, Yangyang Zheng, Pingyue Sheng, Jiayu...
未来预测学习
机器人泛化策略
流匹配
混合专家网络
视觉-语言-动作模型
用对抗式求解器校准自动合成处于可学习区间的终端任务,大幅提升智能体训练效果。
Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao,...
SFT蒸馏
可验证任务构造
智能体训练
求解器校准
终端任务合成
用预测版面分叉内容分支并行解码,端到端文档解析大幅提速
Hao Yu, Jiabo Zhan, Kang Liu, Linnan Zhao, Dongxu Yue, Rui Chen, Jinglin...
KV缓存复用
多模态大模型
并行解码
文档解析
版面分析
用VLM显式推理物体诱导效果,实现高保真视频对象擦除。
Feier Wu, Wanke Xia, Xu He, Zilang Zhou, Si Chen, Dongxia Liu, Liyang Chen,...
对象-效果推理
扩散变换器
视觉语言模型
视频修复
视频物体擦除
首个意第绪语8B开源模型,配套新语料库Oytser与多任务评测基准Kashes
Uri Katz, Omer Goldman, Tomasz Limisiewicz, Reut Tsarfaty, Noah A. Smith
低资源语言
多语言大模型
意第绪语
持续预训练
数字人文
用When/Where/How三轴框架重定义大模型时代的持续学习
Zhiyan Hou, Dan Zhang, Tao Feng, Liyuan Wang, Wei Li, Xiangzhao Hao, Hongyan...
大语言模型
持续学习
智能体
测试时训练
灾难性遗忘
视觉编码器会利用图像元数据痕迹作为捷径,源自预训练中元数据与语义的相关性,可缓解且利于检测生成图像
Vladan Stojnić, Ryan Ramos, Giorgos Kordopatis-Zilos, Noa Garcia, Giorgos Tolias
分布外泛化
图像元数据
捷径学习
生成图像检测
视觉编码器
统一模型实现多镜头视频生成、参考生成与编辑,单GPU达16.74FPS。
Xu Guo, Zhengxuan Wei, Xinghui Li, Hanzhuo Huang, Xinyu Liu, Xiangyang Luo,...
RoPE
一致性蒸馏
交互式创作
多镜头视频
扩散模型
借鉴网游权威服务器架构,以类型化共享状态解耦世界推演与视角渲染。
Ziqi Cai, Siqi Yang, Yimu Wang, Zixian Gao, Yunheng Liu, Shuchen Weng, Erwin...
Transformer
世界模型
多玩家模拟
游戏AI
状态空间建模
提出DENSEWORLD基准与FactorJEPA,将未来潜表示因子分解为布局、智能体、交互三通道
Kapil Wanaskar, Gaytri Jena, Aman Chadha, Vinija Jain, Vasu Sharma, Amitava Das
DINOv2
JEPA
世界模型
南半球城市
因子分解
训练免、无需预训练模型的3D高斯稀疏涂鸦交互式物体选择框架
Baihan Yang, Tiexin Li, Yuheng Liu, Xin Lin, Xinke Li, Xiaohui Xie, Truong Nguyen
3D Gaussian Splatting
交互式分割
图割优化
场景编辑
物体选择
以「权重 vs 技能」为轴,梳理 77 个机器人学习系统的自我改进谱系
Gaytri Jena, Kapil Wanaskar, Vinija Jain, Aman Chadha, Vasu Sharma, Amitava Das
代码即策略
技能库
技能经济
机器人学习
综述
仅对翻译任务启用流匹配、其余任务按语义路由对比目标,配三阶段课程实现多语言嵌入均衡适配
Tirth Bhatt, Naren Kumar S, Mayank Singh
印度语言NLP
多语言嵌入
对比学习
文本嵌入适配
流匹配