首个由学生真实学术任务驱动的OpenClaw学术级智能体评测基准
Junjie Yu, Pengrui Lu, Weiye Si, Hongliang Lu, Jiabao Wu, Kaiwen Tao, Kun...
2026-05-05
OpenClaw
基准测试
大语言模型
学术任务
智能体评测
LLM 稀疏引导多智能体同时学习内部搜索与外部协作
Zi-Bo Qin, Feng-Feng Wei, Tai-You Chen, Wei-Neng Chen
2026-05-04
分布式优化
多智能体系统
大语言模型
群体智能
黑盒优化
揭示LLM在推理任务中偏好任务合理性胜过指令遵从,并提出激活层干预方案。
Xingwei Tan, Marco Valentino, Mahmud Elahi Akhter, Yuxiang Zhou, Maria...
2026-05-01
CoT忠实性
大语言模型
推理可控性
机制可解释性
激活引导
首篇系统梳理 LLM 驱动对话用户模拟的综述,提出 Who/What/How 三维统一分类法。
Bo Ni, Leyao Wang, Yu Wang, Branislav Kveton, Franck Dernoncourt, Yu Xia,...
2026-04-30
大语言模型
对话系统
智能体
用户模拟
综述
用LLM编排Elements系列原子模型工具,4阶段流水线从240万晶体筛出6.8万候选并合成4种新超导。
Mingze Li, Yu Rong, Songyou Li, Lihong Wang, Jiacheng Cen, Liming Wu, Anyi...
2026-04-30
AI智能体
从头设计
原子基础模型
大语言模型
材料发现
用最后一层隐藏表征与预测误差的对齐代替反向传播,单次前向实现千亿级模型的数据估值。
Wenlong Deng, Qi Zeng, Jiaming Zhang, Minghui Chen, Zixin Ding, Christos...
2026-04-28
大语言模型
影响函数
微调
数据估值
视觉语言模型
将前向KL与反向KL按token级信号混合,结合off-policy数据与轻量on-policy采样的统一蒸馏框架
Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu
2026-04-24
代码生成
大语言模型
强化学习
推理
知识蒸馏
把骨骼序列规则化转成自然语言文本,让LLM直接做运动问答与描述,无需训练运动编码器。
Yao Zhang, Zhuchenyang Liu, Thomas Ploetz, Yu Xiao
2026-04-24
LoRA微调
人体运动理解
大语言模型
无编码器
结构化描述
把多词表达资源按「分类/抽取/解释」三种原子操作重组,构建操作对齐的语义基准
Yang Liu, Hongming Li, Melissa Xiaohui Qin, Qiankun Liu, Chao Huang
2026-04-21
多词表达
大语言模型
评测基准
语义理解
首个系统性研究 LLM 稠密检索器在 30 个数据集上泛化与抗扰动鲁棒性的工作,提出 specialization tax 概念。
Yongkang Li, Panagiotis Eustratiadis, Yixing Fan, Evangelos Kanoulas
2026-04-21
Embedding
信息检索
大语言模型
稠密检索
鲁棒性评估
通过只更新Q/K投影中高幅度激活对应的权重行实现长上下文RL稀疏更新。
Bowen Ping, Zijun Chen, Tingfeng Hui, Qize Yu, Chenxuan Li, Junchi Yan, Baobao Chang
2026-04-17
GRPO/DAPO
大语言模型
强化学习
激活稀疏性
长上下文
BLD方法:基于字节级接口的跨分词器蒸馏简化基线
Avyav Kumar Singh, Yen-Chen Wu, Alexandru Cioba, Alberto Bernacchia, Davide Buffelli
2026-04-17
大语言模型
字节级建模
知识蒸馏
跨分词器
在数学竞赛中,模型本身的能力差距远超任何提示工程优化
Natapong Nitarach
2026-04-17
MoE模型
多数投票
大语言模型
推理时优化
提示工程
将推理任务重构为序列级上下文强盗问题,用标量价值函数解决PPO在长链推理中的信用分配不稳定问题
Tianyi Wang, Yixia Li, Long Li, Yibiao Chen, Shaohan Huang, Yun Chen, Peng...
2026-04-15
Chain-of-Thought
PPO
大语言模型
强化学习
推理任务
用历史错误模式的记忆惩罚,缓解 LLM 强化学习的错误坍缩。
Yang Liu, Enxi Wang, Yufei Gao, Weixin Zhang, Bo Wang, Zhiyuan Zeng, Yikai...
2026-04-14
多样性探索
大语言模型
奖励塑形
强化学习
推理
基于轨迹正确性和困惑度进行双路自适应加权的在线策略蒸馏框架,提升LLM推理对齐效果
Binbin Zheng, Xing Ma, Yiheng Liang, Jingqing Ruan, Xiaoliang Fu, Kepeng...
2026-04-14
大语言模型
奖励建模
强化学习
推理对齐
知识蒸馏
首篇系统综述 LLM 强化学习中信用分配的论文,梳理 2024-2026 年 47 种方法并提出粒度×方法学二维分类体系。
Chenchen Zhang
2026-04-14
信用分配
大语言模型
强化学习
推理RL
智能体
首个针对流水线并行的LLM后门攻击,触发词注入使SFT后模型丧失安全对齐。
Oğuzhan Ersoy, Nikolay Blagoev, Jona te Lintelo, Stefanos Koffas, Marina...
2026-04-13
去中心化训练
后门攻击
大语言模型
安全对齐
流水线并行
筛选少量高方差用户提示,让 RL 提示优化在异质推理任务上突破全量训练瓶颈。
Zhaolin Gao, Yu, Wang, Bo Liu, Thorsten Joachims, Kianté Brantley, Wen Sun
2026-04-13
大语言模型
奖励方差分析
强化学习
推理任务
提示优化
DBCooker:基于LLM的数据库原生函数自动合成系统,三大模块协同覆盖声明解析、参考单元复用与自适应编排,在三大主流数据库上平均准确率提升34.55%。
Wei Zhou, Xuanhe Zhou, Qikang He, Guoliang Li, Bingsheng He, Quanqing Xu, Fan Wu
2026-04-10
代码生成
大语言模型
数据库系统
智能体
软件工程