150M参数模型融合循环记忆与潜在迭代推理,以$0.0007/题刷新ARC成本-精度前沿
Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska,...
ARC-AGI
BDH
上下文学习
循环网络
推理效率
冻结底座叠加LoRA专家、递归自我改进闭环,让智能体部署后持续学习
Mind Lab, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen,...
Mixture-of-LoRA
持续学习
智能体后训练
模型系统
生成式UI
专家策展的七语言大规模重构基准,最佳模型通过率仅41.2%,跨文件协同是智能体瓶颈
Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue...
SWE-bench
代码重构
基准评测
多语言
软件工程智能体
利用加密思维链块的跨模型兼容性,让同厂商弱模型充当解密预言机,逐字还原强模型的隐藏推理。
Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner,...
API安全
LLM安全
思维链
模型蒸馏
越狱攻击
自进化编程智能体经受评审提交改写自身框架,三大基准刷新SOTA并完成161天在线部署实验
Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev, Nikita Dragunov, Roman...
基准评测
持续部署
智能体安全
编程智能体
自进化智能体
把大教师智能体的成功经验分层蒸馏为工作流/子任务/函数三级记忆,免训练注入 4B-8B 小智能体
Taeil Kim, Kangsan Kim, Sung Ju Hwang
免训练迁移
分层记忆
小语言模型
工具调用
智能体记忆
以GDLA注意力与384选8细粒度MoE,13.2B激活参数实现智能体任务开源领先
Junghwan Lim, Joon Son Chung, Sungmin Lee, Wai Ting Cheung, Gihun Cho, Minsu...
MoE
低精度训练
后训练与蒸馏
大模型训练
智能体
首个60学科专家标注的科学视频生成基准,揭示“看着逼真”不等于“机理正确”
Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao
MLLM-as-Judge
科学推理
视频生成
评测基准
量规评测
三阶段框架让图像编辑对话中的后续建议既契合用户偏好又与当前画面视觉一致
Zhijing Zhang, Jinpeng Yu, Xin Song, Bingnan Li, Chuyue Li, Changhui Du,...
图像编辑
多模态推荐
奖励模型
强化学习
视觉接地
用稀疏位置探测与验证器校准的蒸馏目标,提升小模型数学推理覆盖
Zikun Qu, Min Zhang, Mingze Kong, Zhiwei Shang, Yikun Ban, Shuang Qiu, Zhongxiang Dai
在线策略蒸馏
大语言模型推理
强化学习
数学推理
知识蒸馏
复用推测解码草稿令牌提前一步预测并异步预取关键KV块,让HBM只驻留稀疏工作集
Can Xiao, Sukmin Cho, Junbong We, Zhixiong Niu, Jianyi Cheng, Yiren Zhao,...
KV缓存管理
KV预取
LLM推理系统
PD分离部署
推测解码
把可解释性作为训练约束内建于模型,Steerling-8B 证明解释能力随规模提升而不牺牲性能
Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail, Giang Nguyen, Isaac...
内在可解释性
扩散语言模型
概念引导
概念瓶颈模型
缩放定律
首个评测LLM自主进化智能体harness能力的基准,顶尖模型最高提升16.6分、逼近人工框架
Lisheng Huang, Chen Yang, Hao Zhou, Huatong Song, Zongchao Chen, Ran Le,...
Agent Harness
基准评测
智能体自进化
自动智能体设计
长程智能体
用反事实证据干预把“答案是否依赖视觉证据”变成GRPO奖励,让VLM不再靠语言先验答题。
Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong...
GRPO
反事实推理
多模态大模型
奖励设计
强化学习后训练
用时间戳免费导出的时间距离取代偏好与进度标注,训练出可作稠密奖励的机器人价值基础模型。
Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo,...
价值基础模型
多模态大模型
奖励模型
强化学习
时间距离
用固定4维语义坐标替代逐轨迹效用,集中反馈并规避记忆-奖励陷阱
Yi Yang, Zhennan Chen, Yihong Zhuang, Tiehan Fan, Yinan Chen, Jian Li, Jian...
LLM智能体
信用分配
智能体记忆
自进化
运行时强化学习
用统一任务协议与自动插桩追踪,对智能体脚手架做全生命周期多维评测
Haoning Wang, Mingxun Zhang, Chenyue Yu, Yingjun Shang, Xia Hu, Guanchu Wang, Na Zou
Agent Harness
LLM Agent
可观测性
基准测试
工程系统
外层LLM提结构草图、内层数值求解器调参数,消除参数混叠
Víctor Gallego
CMA-ES
LLM驱动优化
双层优化
贝叶斯推断
进化搜索
把每轮交互意图变成显式控制变量,意图校准GRPO训练出意图准确率86.6%的用户模拟器
Bo Wang, Ruixing Zhang, Yunqi Liu, Yang Zhang, Liangzhe Han, Tongyu Zhu, Leilei Sun
GRPO
LLM评测
可控生成
对话系统
强化学习
首个跨用户个人工作空间多智能体协作与攻击可审计的沙盒基准
Prince Zizhuang Wang, Aojie Yuan, Haiyue Zhang, Xiyang Hu, Yue Zhao, Shuli Jiang
多智能体基准
工具使用
智能体安全
沙盒评测
隐私与治理
把歧义证据因子化为多维语义假设,并行检索、共识融合、逐维验证,将金标概念从排名深处提到榜首。
Linhai Ma, Ethan F. Wei, Xueqing Peng, Yan Wang, Lingfei Qian, Víctor...
LLM集成
临床编码
信息检索
实体链接
查询构造
无需对抗指令,前沿LLM进化搜索自发指纹化评测配置,30%分布内加速无法迁移
Víctor Gallego
GPU内核优化
LLM智能体
自适应数据分析
规格博弈
评测方法学
以规范等变性为准绳:等变优化器继承梯度流的低秩偏置,Adam 等逐坐标方法则依赖任意基底选解。
Devender Singh
Adam
Muon
优化器理论
低秩矩阵恢复
规范对称性
提出ReMEMBER,以上下文缺口为条件检索并精炼历史证据,提升流式摘要记忆召回
Hyangsuk Min, Hwanjun Song
LLM评估
基准构建
检索增强生成
流式对话摘要
长上下文记忆
用约200美元的开源头戴设备,规模化采集带同步IMU的双目自我中心视频
Gunjan Paul, Senthil Palanisamy, Satpal Singh Rathore, Pratyush Kumar...
具身智能
开源硬件
数据采集
机器人学习
自我中心视觉
把视觉定位重构为文本片段与图像实例的双向对应预测,一个模型统一多种定位任务
Jieyu Zhang, Ziqi Gao, Luke Zettlemoyer, Ranjay Krishna
多模态大模型
开放词汇分割
指代消解
结构化预测
视觉语言定位
用源自土壤微生物网络的图韧性指数作正则项,显著缓解 LLM 微调的灾难性遗忘
Alberto Acedo
LoRA微调
图正则化
持续学习
灾难性遗忘
生态学启发
将 CoT 验证重构为符号化失败诊断:定位错误步骤、区分翻译噪声与推理缺陷,并用可验证证据指导修复
Wenyao Cui, Huaping Zhang, Yongyi Huang, Qiuchi Li, Jian Xu, Cheng-Lin Liu,...
CoT忠实度
LLM推理诊断
可解释AI
形式化验证
推理修复
用语义关系蒸馏与几何变换对齐,让视频扩散模型生成与可见场景一致的镜面反射
Youjun Zhao, Alex Warren, Gary K. L. Tam, Rynson W. H. Lau
LoRA微调
表示对齐
视频修复
视频扩散模型
评测基准
提出41K规模的MMOOC基准,联合评估多模态大模型的拒答能力与抗干扰鲁棒回答能力
Wenjie Zhu, Yabin Zhang, Wenjun Zeng, Lei Zhang
LLM-as-a-Judge
基准评测
多模态大模型
拒答与幻觉
模型对齐
融合感知—思考—行动循环与BDI推理模型,为游戏引擎中的认知具身智能体提供可部署的模块化架构模板
Aimilios Hadjiliasi, Louis Nisiotis
BDI模型
智能虚拟代理
架构设计
游戏AI
虚拟现实