用世界模型替代昂贵的沙箱执行训练研究智能体,在线去偏去噪,训练加速3-4倍且性能更优。
Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan...
LLM后训练
世界模型
具身智能
强化学习
自动研究智能体
用紧凑的语义动作接口,让基础 VLM 零样本或数 GPU 小时微调即可直接操控机器人
Yanzhe Chen, Zechen Bai, Zhijun Cao, Wenzheng Zeng, Kevin Qinghong Lin, Yiqi...
Sim-to-Real
VLA 对比
VLM 智能体
具身智能
机器人操作
用可执行程序维护显式世界状态,把视频模型降级为纯粹的生成式渲染器
Zheng-Hui Huang, Guixu Lin, Jiacheng Lin, Yi-Chuan Huang, Ruihan Yu, Muyao...
3D场景理解
世界模型
交互式环境
可控视频生成
生成式渲染
以顺序干预定位失败责任智能体,再聚类抽象文本梯度以优化多智能体提示词
Jaewon Chu, Jinwoo Seo, Jaewon Cho, Jeehye Na, Yunyang Xiong, Youngdae Kim,...
LLM智能体
多智能体系统
失败归因
提示词优化
文本梯度
密集执行奖励+TITO/R3稳定化,将122B MoE模型RL训练为64.0%解题率的终端智能体
Junyao Yang, Yucheng Shi, Zhongzhi Li, Ruhan Wang, Zongxia Li, Haitao Mi,...
MoE训练稳定性
PPO
可验证奖励
强化学习
终端智能体
用200名真实用户500天可穿戴数据出4084道10选1题,14个大模型最高仅72.9%
Ji Soo Lee, Xilun Chen, Pierce Chuang, Ashish Shenoy, Jason Wei, Dohwan Ko,...
医疗健康AI
大语言模型
数据集构建
时间序列推理
评测基准
封堵SWE-Bench Pro的答案泄漏并修复题目缺陷,发布731题防作弊验证版基准
Pujun Zheng, Zixin Shang, Shufan Jiang, Wenhui Tian, Dongsheng Zhu, Zerun...
LLM智能体
基准评测
数据质量
软件工程
冻结子代理并行读全文,主代理散射-聚合多轮推理,长文多跳问答更准且最高提速11倍。
Kun Li, Zexuan Qiu, Tianhua Zhang, Irwin King, Helen Meng
多智能体协作
多跳问答
强化学习
推理效率
长上下文
首个把智能体当“SAE 科学家”考试的基准:概念选择性逼近专家,因果转向严重落后
Yuqiao Tan, Shizhu He, Jun Zhao, Kang Liu
AI智能体基准
机制可解释性
激活转向
特征发现
稀疏自编码器SAE
首个物体接地且姿态感知的协同语音手势扩散模型,在因果潜空间实现时序可控、无穿模的手势合成
Vida Adeli, Soroush Mehraban, Jacob Rommann, Harrison Sanborn, Cole...
SMPL-X
人体-场景交互
协同语音手势生成
合成数据集
因果潜空间
用密封验证、恢复审计与反馈配对三道门,把AI科研高分变成可复放的发现证书
Jingjie Ning, Shanshan Zhong, Xiaochuan Li, Ji Zeng
AI Agent
可复现性
科学发现验证
统计审计
评测方法
推理轨迹中段约20%是冗余的:SFT只保留首尾,效果反超完整轨迹训练
Jaehui Hwang, Sangdoo Yun, Byeongho Heo, Dongyoon Han
SFT
大语言模型
强化学习
推理训练
数据质量
用视觉校准片段教会动作条件世界模型零样本适应未见环境
Yuncong Yang, Zhengtao Han, Furkan Ozyurt, Zeyuan Yang, Han Yang, Junyi Cao,...
世界模型
机器人学习
测试时扩展
视频预测
零样本泛化
用85个源自真实论文与仓库的任务,测出最强模型仅36.53%的基础设施工程能力
Leilei Ding, Shumin Wang, Yuting Huang, Fanqi Wan, Yinmin Zhang, Qi Han,...
GPU内核优化
LLM基础设施
智能体评测基准
端到端系统优化
长程任务
全自动流水线从158万专利抽取2400万条可溯源细粒度有机反应记录,服务研究者与AI智能体
Yubin Wang, Xingjian Wei, Jiang Wu, Yinfan Wang, Boyu Zhu, Lin Zhang,...
AI4Chem
MCP智能体
信息抽取
化学信息学
反应检索
以最后可用真值为跨尺度参考约束递归超分训练,无真值深尺度幻觉降低2–5倍且质量达SOTA
Shubhashis Roy Dipta, Sourajit Saha, Shaswati Saha, Nobin Sarwar
图像超分辨率
在线策略自蒸馏
幻觉抑制
扩散模型
无参考质量评估
监测模型轨迹稳定化信号,自适应地从重训练切换到微调,省时且保校准
Nagham Omar, Maya Rozenshtein, Evgeny Mishlyakov, Avigdor Gal
主动学习
文本分类
校准
训练策略
高效训练
按编码器–连接器–LLM 流水线四阶段梳理视频大模型推理效率机制,给出受控对比与研究议程
Killian Steunou, Yannis Tevissen, Mounîm A. El Yacoubi
Token压缩
VideoLLM
推理效率
综述
音频视觉
构建400场景因子化基准与SCOUT监控器,定量解析LLM智能体阴谋行为的驱动因素
Jie Ruan, Inderjeet Nair, Amy Liu, Muhammad Khalifa, Yusheng Zhou, Lu Wang
LLM-as-a-Judge
LLM智能体安全
可监控性
基准构建
阴谋行为评测
把广告视频生成分解为策略选择与草稿生成两阶段,用线上业务反馈训练奖励模型驱动DPO+GRPO优化。
Xingyuan Bu, Chengru Song, Hao Zhou, Tao Zhou, Dong Li, Wei Li, Shilong Li,...
DPO
GRPO
在线A/B实验
奖励模型
强化学习
四种受控对比模型实证表明整文件直接生成全面优于Diff迭代编辑,Diff仅在短局部编辑占优
Andrej Andrejev
LLM评测
代码生成
代码编辑
实证研究
训练目标设计
用会话、语义、嵌入三层Redis缓存,在普通CPU上把AI搜索成本压到每次约1.5美分
Ayushman Bhattacharya, Nihal Gazi
LLM系统
Redis
成本优化
检索增强生成
系统工程
450 道研究生随机过程 Lean 4 基准,最强智能体证明率 34.9%
Idan Davidovich, Debargha Ganguly, Vikash Singh, Vipin Chaudhary
LLM 智能体
Lean 4
基准测试
形式化定理证明
自动形式化
专家轨迹模仿在进化框架下令弱模型全面退步,在线策略单回合修正可保框架适配并持续增益
Zhou Yu, Bin Bi, Shiva Kumar Pentyala, Shubham Mehrotra, Sougata Chaudhuri,...
LLM智能体
LoRA微调
专家轨迹
协同进化
在策略学习
提出关系感知情感支持对话新任务,用真实伴侣与家庭访谈基准揭示大模型关系推理短板
Haichuan Hu, Yang Xiao, Mingni Tang, Jiawen Duan, Quanjun Zhang, Congqing...
LLM评估
关系建模
基准评测
多方对话
心理治疗
把MEG信号映射进语义嵌入空间再反演成文本,免词级对齐实现非侵入式语音解码
Gilad D. Landau, Dulhan Jayalath, Oiwi Parker Jones
MEG
脑机接口
表征学习
语义表示
语音解码
用难度自适应树搜索、句子熵分叉与兄弟多样性奖励扩展 RLVR 的 pass@k 推理覆盖
Youngjun Yu, Sanghwan Jang, Hwanjo Yu
GRPO
RLVR
探索策略
推理覆盖
树搜索
首个用 LLM 智能体贯通自动驾驶规划器场景测试全流程的统一对话式框架
Yuan Gao, Sebastian Müller, Mattia Piccinini, Marc Kaufeld, Yuchen Zhang,...
LLM智能体
场景生成
基准评测
提示工程
自动驾驶测试
DF26基准显示人类与最先进检测器识别AI生成视频的能力已接近随机
Severyn Shykula, Andrii Yermakov, Ivan Samarskyi, Dmytro Mishkin, Jan Cech,...
全合成视频
基准数据集
深度伪造检测
视频生成
跨生成器泛化
用影响函数选样本、改写其回答而非调权重,可显著放大SFT行为干预效果
Yuzhang Luo, Chenpeng Wang, Jianhui Chen, Liangming Pan
影响函数
数据干预
监督微调
认知性拒答
训练数据归因
用锚点句相似度把微调前后隐空间投到共享坐标系,ΔB 检测偏见漂移,快 3–50 倍。
Marek Jeliński, Jan Dubiński, Maciej Chrabaszcz, Sebastian Cygert
LLM安全
偏见审计
模型对比
相对表示
隐状态分析
首次闭合稀疏测量下支撑恢复的信息论阈值,量化测量稀疏化换取样本量的精确代价。
Youssef Chaabouni, David Gamarnik
Chernoff界
信息论极限
压缩感知
相变
稀疏恢复