首个RL驱动的智能体图学习框架,让LLM自主用图原生工具搜索后做节点分类/链接预测。
Yuanfu Sun, Kang Li, Dongzhe Fan, Jiajin Liu, Qiaoyu Tan
2026-04-09
图学习
大语言模型
强化学习
文本属性图
智能体系统
揭示并缓解 naturalness-based 推理数据选择中的步骤长度偏差,使小模型推理 SFT 平均提升 6-9 个百分点。
Bing Wang, Rui Miao, Chen Shen, Shaotian Yan, Kaiyuan Liu, Ximing Li,...
2026-04-09
因果去偏
大语言模型
数据选择
监督微调
长链思维推理
基于多智能体架构的学术文献发现与深度理解平台,支持跨源检索、知识图谱构建和自动化评审
Komal Kumar, Aman Chadha, Salman Khan, Fahad Shahbaz Khan, Hisham Cholakkal
2026-04-08
多智能体系统
大语言模型
文献发现
知识图谱
研究自动化
用更精细相似度+伪剪枝+逐层重计算,MoE 专家压缩新方法
Saurav Jha, Maryam Hashemzadeh, Ali Saheb Pasand, Ali Parviz, Min-Joong Lee,...
2026-04-08
Mixture-of-Experts
专家压缩
大语言模型
模型剪枝
模型合并
针对LLM代码修复中的「过度编辑」问题,提出编辑感知奖励与自造数据框架,显著提升修复精度与推理速度。
Changxin Ke, Rui Zhang, Jiaming Guo, Yuanbo Wen, Li Ding, Shuo Wang, Xuyuan...
2026-04-08
代码修复
大语言模型
强化学习
推理加速
程序正确性
提出文本频率定律:同等语义下高频文本更适合 LLM 提示与微调,结合 TFD 蒸馏与 CTFT 课程训练在 4 大任务验证。
Hongyuan Adam Lu, Z. L., Victor Wei, Zefan Zhang, Zhao Hong, Qiqi Xiang,...
2026-04-07
大语言模型
提示工程
数学推理
数据选择
机器翻译
用预 RoPE 空间的 Q/K 中心点估计 KV 重要性,匹配全注意力的同时吞吐提升 2.5 倍。
Weian Mao, Xi Lin, Wei Huang, Yuxin Xie, Tianfu Fu, Bohan Zhuang, Song Han,...
2026-04-07
KV Cache 压缩
RoPE 分析
大语言模型
长链路推理
高效推理
自动发现、总结和分析热门AI论文的开源平台,揭示研究趋势动态
Mingzhe Du, Luu Anh Tuan, Dong Huang, See-kiong Ng
2026-04-07
大语言模型
文献分析
知识发现
研究工具
趋势分析
通过任务重构和自适应课程学习解决RLVR中无法从pass@64=0的困难问题学习的根本局限
Justin Chih-Yao Chen, Archiki Prasad, Zaid Khan, Joykirat Singh, Runchu...
2026-04-07
任务重构
大语言模型
强化学习
推理能力
课程学习
统一数据选择、混合和重加权的动态训练框架
Hao Liang, Zhengyang Zhao, Meiyi Qiang, Mingrui Chen, Lu Ma, Rongyi Yu,...
2026-04-03
分布式训练
动态训练
大语言模型
数据中心AI
数据选择
系统综述语言模型潜空间研究的全景综述,按机制与能力双轴梳理200余项工作。
Xinlei Yu, Zhangquan Chen, Yongbo He, Tianyu Fu, Cheng Yang, Chengming Xu,...
2026-04-03
大语言模型
潜在推理
潜空间
综述
连续思维
首个系统性评估 AI 写作代理的框架,从展示质量和幻觉两个维度量化 AI 撰写科学论文的能力与风险。
Atsuyuki Miyai, Mashiro Toyooka, Zaiying Zhao, Kenta Watanabe, Toshihiko...
2026-04-02
AI写作评估
大语言模型
幻觉检测
科学写作
评估框架
提出基于非对称FSM的Pare框架,通过模拟真实用户交互来评估主动助手。
Deepak Nathani, Cheng Zhang, Chang Huan, Jiaming Shan, Yinfei Yang, Alkesh...
2026-04-02
主动助手
人机交互
基准测试
大语言模型
智能体
系统性综述LLM在线策略蒸馏(OPD)的理论框架、方法分类、失败模式和工业实践
Mingyang Song, Mao Zheng
2026-04-02
在线策略学习
大语言模型
强化学习
模仿学习
知识蒸馏
通过引入Future-KL散度重构GRPO的信用分配机制,突破LLM推理长度停滞瓶颈
Chiyu Ma, Shuo Yang, Kexin Huang, Jinda Lu, Haoming Meng, Shangshang Wang,...
2026-04-01
GRPO
信用分配
大语言模型
强化学习
推理能力
系统评估LLM通过纯文本训练获得的听觉知识及其对音频理解性能的影响
Ke-Han Lu, Szu-Wei Fu, Chao-Han Huck Yang, Zhehuai Chen, Sung-Feng Huang,...
2026-04-01
多模态学习
大语言模型
知识评估
跨模态推理
音频语言模型
文本与结构化数据集成的挑战与前沿方法综述
Md Ataur Rahman, Dimitris Sacharidis, Oscar Romero, Sergi Nadal
2026-03-31
信息抽取
大语言模型
数据集成
知识图谱
自然语言处理
Cursor发布专用编码智能体模型Composer 2,经继续预训练+强化学习训练
Cursor Research, Aaron Chan, Ahmed Shalaby, Alexander Wettig, Aman Sanger,...
2026-03-30
MoE模型
代码生成
大语言模型
强化学习
软件工程智能体
金融场景下LLM调用MCP工具的评测基准,含613样本与65个工具
Jie Zhu, Yimin Tian, Boyang Li, Kehao Wu, Zhongzhi Liang, Junhui Li, Xianyin...
2026-03-27
MCP
大语言模型
工具调用
智能体
评测基准
用自主编程智能体替代进化搜索中的变异算子,生成超越专家优化的GPU注意力内核
Terry Chen, Zhifan Ye, Bing Xu, Zihao Ye, Timmy Liu, Ali Hassani, Tianqi...
2026-03-27
GPU内核优化
大语言模型
注意力机制
自主智能体
进化计算