找到 448 条结果

用扩散模型学习LLM激活分布,作为先验提升引导干预和可解释性

Grace Luo, Jiahai Feng, Trevor Darrell, Alec Radford, Jacob Steinhardt 2026-02-09
元学习 可解释性 大语言模型 扩散模型 激活建模

通过蒸馏MCTS搜索树和蒙特卡洛评论家,让LLM智能体内化准确的前瞻推理能力

Yangbin Yu, Mingyu Yang, Junyou Li, Yiming Gao, Feiyu Liu, Yijun Yang,... 2026-02-06
大语言模型 强化学习 推理蒸馏 智能体 游戏AI

构建920万数学定理语料库并实现语义检索系统,在专业数学查询上显著优于现有工具。

Luke Alexander, Eric Leonen, Sophie Szeto, Artemii Remizov, Ignacio Tejeda,... 2026-02-06
向量嵌入 大语言模型 数学信息检索 数学定理 语义搜索

提出可学习的潜在记忆框架,通过角色感知的潜变量优化解决多智能体记忆同质化和信息过载问题

Muxin Fu, Guibin Zhang, Xiangyuan Xue, Yafu Li, Zefeng He, Siyuan Huang,... 2026-02-06
多智能体系统 大语言模型 强化学习 潜在表示 记忆机制

提出MT-GRPO算法,通过自适应任务加权和比例保持采样实现多任务推理的均衡优化

Shyam Sundhar Ramesh, Xiaotong Ji, Matthieu Zimmer, Sangwoong Yoon, Zhiyong... 2026-02-06
后训练 多任务学习 大语言模型 强化学习 推理能力

基于真实论文构建的生物学实验推理基准,评估LLM因果推理能力

Junting Zhou, Jin Chen, Linfeng Hao, Denghui Cao, Zheyu Wang, Qiguang Chen,... 2026-02-06
基准测试 大语言模型 实验推理 生物信息学 科学评估

用 KL3 估计器替代 GRPO 中的对称裁剪,实现有理论保证的非对称近信赖域约束

Qingyuan Wu, Yuhui Wang, Simon Sinong Zhan, Yanning Dai, Shilong Deng, Sarra... 2026-02-06
GRPO 信赖域方法 大语言模型 强化学习 策略优化

将LLM多智能体推理从个体层面提升到集群层面,通过神经符号融合实现可扩展、校准良好的群体动态模拟

Kavana Venkatesh, Yinhan He, Jundong Li, Jiaming Cui 2026-02-06
不确定性量化 多智能体系统 大语言模型 智能体建模 流行病模拟