不改权重,用状态机运行时让智能体达 95.3%,或仅花 15 美元匹敌前沿
Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang, Kai Wang
Terminal-Bench
成本-性能前沿
智能体脚手架
状态机运行时
过程性记忆
按目标剩余提升空间动态重加权组相对优势,把RL优化力度转向未饱和目标
Yixuan Wang, Yifei Chen, Haichao Zhang, Haozheng Luo, Xander Wu, Jie Ni, Yun...
GRPO
LLM推理
RLVR
多奖励策略优化
强化学习
分层智能体评测流水线把世界模型评分变成可审计的证据树,判断与人类高度一致
Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai,...
VLM-as-Judge
世界模型
可解释性
智能体评测
视频生成
LLM提议候选、高斯过程校准不确定性,采集函数统一调度推理算力与昂贵实验,实现跨域科学发现
Zhongwei Yu, Yan Song, Xue Yan, Anjie Liu, Xingyu Lu, Yihang Chen, Huichi...
LLM智能体
序列与分子设计
测试时计算
科学发现
贝叶斯优化
首个3D世界构建智能体的评测+多模态RL训练框架,开源30B模型Pass@1超越GPT-5.5
Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li,...
3D场景生成
Agentic RL
Benchmark
GRPO
具身智能
用门控交叉注意力与轻量实时SFT实现"边看边说"的开源视觉语言模型家族
Pengyu Wang, Chenkun Tan, Shaojun Zhou, Qirui Zhou, Yanxin Chen, Xingyang...
实时视频理解
技术报告
数据合成
流式推理
视觉语言模型
开源27B GUI智能体:环境闭环数据训练+子任务级示范引导,登顶开源计算机操作基准
Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang,...
GUI智能体
上下文示范学习
基准评测
强化学习
数据引擎
把黑盒智能体框架当作不透明环境,用沙箱、服务代理与前缀树实现稳定的智能体RL
Huatong Song, Fei Bai, Ming Yang, Renyuan Li, Jia Deng, Jujie He, Zhange...
Agent Harness
LLM智能体
后训练
强化学习
黑盒优化
潜空间预训练再迁移像素空间后训练的实证配方,质量持平潜空间模型且推理快3.18–4.75倍
Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe...
像素空间生成
实证研究
扩散模型
文生图
步数蒸馏
800条轨迹与45种失败模式揭示科研智能体普遍缺失元认知闭环
Yanlin Fei, Nazhou Liu, Xinmiao Yu, Shaolong Chen, Lei Li, Rahul Thapa,...
Agent-as-a-Judge
元认知
失败分类法
智能体评估
自动科研
开源三件套:统一基准 RelArena-α、榜首基线 TabPFN-Rel 与声明式接口 RPI
Adrian Hayler, Klemens Flöge, Alan Arazi, Rishabh Ranjan, Jure Leskovec,...
TabPFN
关系学习
可复现性
基准测试
开源框架
用144对物理突变任务检验智能体改代码自救的能力,揭示机制重设计而非参数推断是真瓶颈
Yuhao Zhan, Bingxiang He, Zecong Tang, Chaojun Xiao
LLM智能体
代码生成
基准评测
物理仿真
环境适应
把数据库ACID事务语义引入LLM智能体,KramaBench得分提升10.6%
Zhaoyan Sun, Xiaoxiao Wang, Guoliang Li
LLM智能体
多智能体
数据库事务
数据智能体
系统可靠性
首个智能体文生图工作流路由框架,按提示需求动态分配最优管线,成本降95%延迟降65%
Harold Haodong Chen, Zhiyu Hou, Wen-Jie Shu, Weilin Ruan, Yingjie Xu, Litao...
文生图
智能体工作流
模型路由
高效推理
以8万余条无攻击诱导的有害输出,为23个前沿LLM刻画有害性与多样性双轴风险画像。
Zhouyuan Ma, Yutao Wu, Hanxun Huang, Xiang Zheng, Xiao Liu, Yixin Cao,...
LLM安全评估
基准数据集
智能体工作流
有害内容分布分析
模型风险画像
自适应长度离散部件令牌+长上下文自回归,部件级3D生成扩展至300部件、256k令牌
Manwen Liao, Xinyu Lian, Jian Mao, Kaixu Chen, Li Luo, Jinghao Yan, Wanshui...
3D生成
向量量化VAE
大语言模型
自回归模型
部件感知生成
按物理、社会、自指三级认知框架系统分析智能体AI对人类能动性、自主性与控制力的风险
Guanchu Wang, Qinuo Li, Mengnan Du, Xia Hu, Bowen Zhou
AI风险治理
LLM智能体
对齐
智能体安全
机器意识
梯度优化加 AlphaEvolve 把矩阵乘法指数上界降到 2.371177
Emilien Dupont, Marvin Eisenberger, Borislav Kozlovskii, Abbas Mehrabian,...
AI for Math
理论计算机科学
矩阵乘法
进化搜索
非凸优化
将视频编辑重构为逐比特保留-翻转的证据决策,不足3%条件参数追平开源最优
Feng Xie, Jiagao Hu, Fuhao Li, Zepeng Wang, Yuxuan Chen, Dahua Gao, Fei...
二值量化
参数高效微调
指令驱动编辑
生成精炼网络
视频编辑
用重复请求与长序列探针黑盒审计第三方 API 是否真的在服务所声称的模型
Xiangfan Wu, Zonghao Ying, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong...
KL散度估计
LLM服务安全
模型部署验证
统计假设检验
黑盒审计
把多参考图像生成拆成锚定、解缠、绑定、组合四个算子,构建约1600例基准并定位失败根源
Haoran Wang, Chaofan Ma, Ran Yi, Lizhuang Ma
VLM裁判
多参考图像生成
组合泛化
统一多模态模型
评测基准
共享预算评测显示,LLM竞赛成绩在72格中71格低于其单题能力的离线最优分配
Peisong Wang, Zhiwei Ma, Bowen Liu, Feixue Liu, Aochuan Chen, Chenyi Zi,...
LLM智能体
基准评测
测试时计算分配
组合优化
资源理性推理
把视频理解重构为多轮工具增强任务,20个前沿模型全部低于60%准确率
Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng,...
基准评测
多模态大模型
工具使用
智能体基准
视频理解
用零音频微调的视频扩散模型生成说话视频,再优化成任意角色的3D口型动画
Kwan Yun, Serin Yoon, Sunjin Jung, Jung Eun Yoo, Inyup Lee, Junyong Noh
3D角色动画
Blendshape优化
个性化微调
实时推理
视频扩散模型
固定免记忆近窗推理,用思考模式蒸馏与线索门控让4B学生追平9B教师
Keming Wu, Baoyi Wang, Kaichen Zhang, Xiang An, Zuhao Yang, Sudong Wang,...
后训练
在线策略蒸馏
多模态大模型
强化学习诊断
教师特权信息
训练时预测未来视觉嵌入、推理时直接作答,精度持平或超越Visual CoT且延迟降5倍以上
Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu...
世界模型
后训练
多模态大模型
视频理解
高效推理
用查询条件、长度自适应的潜在概念作中间监督,桥接局部视觉证据与语义相关性
Peng Chunyi, Xu Zhipeng, Yan Yukun, Liu Zhenghao, Yu Shi, Mei Sen, Sun Yubo,...
多模态嵌入
检索增强生成
潜在概念学习
知识蒸馏
表示学习
用私有审计真值图构建企业QA基准,专考语料中从未明说的组织关系推理
Akrin Zheng, Alexander Wu, Alaia Liu
RAG
企业问答
多跳推理
知识图谱
评测基准
以形变感知学习与内容-结构解耦训练,让1.2B参数VLM统一高精度解析数字与拍摄文档
Peng Cai, Zhaofan Zou, Shifa Liu, Yikun Wang, Jiawei Tang, Kaicheng Yang,...
OCR
公式识别
形变矫正
文档解析
表格结构识别
先验审计-修复对话使LLM验证器误报率最多降11.5pp,本质是阈值移动而非判别力提升
Parsa Mazaheri, Kasra Mazaheri
LLM-as-a-Judge
ProcessBench
上下文效应
信号检测论
验证器偏差
任务需求不是放行已就位的变量,而是驱动注意力在中层窗口把变量汇聚到查询位置
Parsa Mazaheri
Jacobian透镜
全局工作空间
机制可解释性
注意力机制
激活补丁
二手V100组建128卡集群,靠流水线优先并行低成本跑LLM推理,但碳可行性取决于绿电。
Zeyu Cao, Xuan Guo, Cheng Zhang, Cheuk Hang Lau, Ilia Shumailov, Yiren Zhao
LLM推理服务
TCO与碳足迹分析
二手GPU
可持续计算
流水线并行
37个LLM的合成问卷受访者不敌无语言模型的copula基线,无法替代真人样本
Mantas Lukauskas, Viktorija Šarkauskaitė
LLM评估
偏见审计
合成数据
基准测试
心理测量学
联合优化取货选择、卡车路径与无人机飞行同步,最大化扣除时间租金后的净收益
Kabir Murjani, Abhay Sobhanan
元启发式算法
旅行窃贼问题
无人机物流
深度强化学习
混合整数规划
把世界探索变成可复用轨迹数据源:一次离线渲染,多视角多外观多模态标注同步产出。
Xiaojie Xu, Zhengyuan Lin, Runyi Li, Yihao Liu, Kaipeng Zhang, Yongtao Ge
4D重建
Unreal Engine
世界模型
全景视频
合成数据
发现RAG投毒会劫持注意力形成坍缩信号,据此提出轻量可解释的检测框架D-SCAN
Yingtao Ren, Ziyi Zhao, Yiwei Fu, Xiao Luo, Yu-Cheng Chang, Chin-Teng Lin
RAG安全
大模型安全
投毒攻击检测
机制可解释性
注意力分析
AI科学家不该只当自主工具研究,而应以人-智能体系统为单位促进人机协同
Patrick Emami, Sameera Horawalavithana, Truc Nguyen, Gihan Panapitiya, Bruno...
AI科学家
LLM智能体
人-智能体系统
人机协同
科学发现
诊断文档抽取朴素风险保证的三种失效模式,提出四级有效性阶梯与条件化两regime定律
Bhaskar Gurram
LLM评估
PAC保证
不确定性量化
共形风险控制
文档信息抽取
六模型两基准实验证明:即便从构造上消除选项顺序影响,也不必然换来LLM准确率提升
Karl Hanna, Chen Feng
LLM评估
去偏策略
多选题基准
实证方法论
负结果
即插即用的2D运动编码器让3D预训练MoLM直接接受2D动作输入,真实视频上反超3D
Kaname Yokoyama, Norimichi Ukita
2D姿态估计
VQ-VAE
人体运动理解
跨模态对齐
运动语言模型
以高保真拓扑感知潜在表示与单阶段有效性约束解码,鲁棒生成结构合法的 B-Rep 模型
Junhao Hou, Chenqi Luo, Pufan Wang, Jiaying Lu, Yusheng Liu, Feiwei Qin,...
B-Rep生成
CAD
几何深度学习
拓扑约束
潜在扩散模型
把严重噪声建模为潜空间低秩仿射畸变,闭式几何修正编译成静态矩阵,免梯度实现亚毫秒级测试时适应
Ashish Anand Shukla, Rini Smita Thakur, Aryan Das, Vinod K. Kurmi
几何去噪
测试时适应
边缘推理
零样本分类
音频-文本基础模型