← 前一天
2026-08-17
后一天 → 今日

以过程指标与对照实验评估七个前沿模型的长程自动研发能力:当前智能体更像工程优化器而非自主研究者

Yiwei Li, Wanli Yang, Hexiang Tan, Xiangzhou Huang, Zhengyu Chen, Ziran Li,...
Agent Harness 智能体评估 经验复用 自动研究Agent 过程评估

LLM 神经元按语言、形式/社会/物理推理四大认知域自发分工,与人脑模块化组织一致

Pengrui Han, Jacob Andreas, Evelina Fedorenko, Andrea Gregor de Varda
因果消融 归因修补 机制可解释性 模块化 神经科学与AI交叉

把机器人执行视频转成进度曲线,用 OPD 指标体系细粒度评估具身模型的过程能力

Yuyang Liu, Yanqing Shen, Ruike Chen, Jifan Zhao, Yuxuan Tian, Yichi Zhang,...
VLA模型 具身智能 机器人操作评估 评测基准 过程奖励模型

固定TPP缩放下最优重复次数随模型变大反而增加,且由领域验证损失主导

Jingwei Li, Xinran Gu, Rui Dai, Xintong Hao, Chengyin Xu, Yan Wu, Shuran...
大模型预训练 数据混合 数据重复 缩放律 过拟合

把测试时算力从多采样转向声明级证伪验证,等调用量下提升数学推理准确率并显著省 token

Sen Xu, Wei Wang, Shixi Liu, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong...
LLM推理 免训练框架 测试时扩展 自洽性聚合 证伪验证

从数学、内核、更新规则到通信全栈加速 Muon 正交化,优化器步时间最多降低约 6 倍

Noah Amsel, Jack Zhang, Kwangjun Ahn, Ali Naeimi, Austin Feng, Berlin Chen,...
GPU内核 Muon 优化器 分布式训练 大模型预训练

低可预测性令校准预测幅度坍缩,逐序列损失漏掉截面排序,CalibRank 兼顾两者

Shu Wan, Miles Ma, Hank Zhu, Guangqi Liu, Stephen Wang, Qingsong Wen, Huan Liu
截面相关性 损失函数设计 时间序列基础模型 模型评测 金融预测

用K-5小学语料从零训练5B模型构建可控知识沙盒,检验规模、后训练与ICL能否突破预训练边界

Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna...
受控预训练 小模型 强化学习后训练 数据过滤 知识边界

RLVR 在提升当前任务的同时,会把未来任务的成功轨迹挤到固定预算内难以采样

Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang
RLVR 大语言模型 强化学习 持续学习 指令跟随

思维模型放大自我修正等行为,但最预测正确性的是置信校准——放大不等于预测

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig
大模型推理 思维链 模型行为分析 评估与基准