用函数感知的FIM中间训练对齐智能体循环,提升SWE-Bench并缓解能力退化
Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping...
SWE-Bench
代码大模型
填空式中间训练
程序依赖图
编码智能体
提出可演进知识边界概念,用搜索智能体协同训练突破图像生成的世界知识瓶颈
Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin,...
多模态检索
扩散模型DPO
搜索增强生成
文本到图像
智能体
用图像条件下的提示词似然,把多模态大模型变成文生图RL的免训练奖励
Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao
免训练方法
图文对齐
多模态大模型
奖励模型
文生图强化学习
首个全合成长文档视觉理解基准,系统揭示VLM三类失败模式
Abhigya Verma, Khyati Mahajan, Amit Kumar Saha, Shruthan Radhakrishna, Sagar...
合成数据
图表理解
文档问答
视觉语言模型
长上下文基准
用235道人能轻松解出、AI却频频翻车的题,诊断前沿模型的顽固盲区
Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo,...
benchmark
evaluation
multimodal
reasoning
vision-language
开放权重多乐器音乐转录模型,结合合成数据预训练、真实数据微调与强化学习后训练
Simon Rouard, Michael Krause, Axel Roebel, Carl-Johann Simon-Gabriel,...
Transformer
多乐器建模
开放权重模型
强化学习
自动音乐转录
首个通用医学影像自主多智能体建模框架,以数据条件规划与验证引导搜索,19/20任务超越基线。
Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng, Cheng Wang, Zipei Wang, Wentao...
LLM Agent
医学影像
可审计AI
多智能体系统
自主机器学习工程
修复前先用问答显式获取仓库知识,显著提升智能体议题解决准确率。
Haotian Lin, Silin Chen, Xiaodong Gu, Yuling Shi, Chengxi Pan, Jiaqi Ge,...
SWE-bench
仓库级问答
代码智能体
多智能体协作
知识获取
面向文档智能的视觉文本基础模型,联合文本生成与像素重建,七大文档任务全面领先
Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song,...
OCR
ViT
文档智能
文档理解
文档解析
用RGB统一视觉任务的输入输出,冻结图像编辑器零样本完成25项感知与生成任务
Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu,...
RGB表示
可控生成
图像编辑
密集预测
统一视觉模型
双路径智能体框架ChartCynics解耦视觉诊断与OCR验证,抵御误导性图表的视觉欺骗
Yanjie Zhang, Yafei Li, Rui Sheng, Zixin Chen, Yanna Lin, Huamin Qu, Lei...
图表问答
强化学习GRPO
智能体框架
视觉语言模型
误导性图表
用轻量探针读取LLM内部激活,校准置信度、揪出思维链隐藏的证据影响。
Raphaël Sarfati, Pratyush Ranjan Tiwari, Siddharth Boppana, Christopher J....
RLVR推理模型
大模型预测
思维链忠实度
机械可解释性
线性探针
证明深度强化学习性能排名随数据量非单调变化,打破高数据区最优即低数据区最优的隐含假设
Ezgi Korkmaz
Arcade学习环境
分布式强化学习
样本复杂度
深度强化学习
缩放定律
提出按六种科研能力组织评测的科学数据分析基准SDABench
Chuhan Shi, Xiaoquan Ren, Sicheng Song, Haobo Li, Rui Sheng, Yushi Sun
LLM评测
因果推理
基准测试
科学数据分析
错误归因
一条文本提示一键生成门户连通、可互相穿行的多场景3D游戏工程
Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan, Shuqing Li, Michael R. Lyu
Unity
场景过渡
多场景生成
大语言模型
文本到3D