找到 448 条结果

首个由学生真实学术任务驱动的OpenClaw学术级智能体评测基准

Junjie Yu, Pengrui Lu, Weiye Si, Hongliang Lu, Jiabao Wu, Kaiwen Tao, Kun... 2026-05-05
OpenClaw 基准测试 大语言模型 学术任务 智能体评测

首篇系统梳理 LLM 驱动对话用户模拟的综述,提出 Who/What/How 三维统一分类法。

Bo Ni, Leyao Wang, Yu Wang, Branislav Kveton, Franck Dernoncourt, Yu Xia,... 2026-04-30
大语言模型 对话系统 智能体 用户模拟 综述

将前向KL与反向KL按token级信号混合,结合off-policy数据与轻量on-policy采样的统一蒸馏框架

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu 2026-04-24
代码生成 大语言模型 强化学习 推理 知识蒸馏

将推理任务重构为序列级上下文强盗问题,用标量价值函数解决PPO在长链推理中的信用分配不稳定问题

Tianyi Wang, Yixia Li, Long Li, Yibiao Chen, Shaohan Huang, Yun Chen, Peng... 2026-04-15
Chain-of-Thought PPO 大语言模型 强化学习 推理任务

首个针对流水线并行的LLM后门攻击,触发词注入使SFT后模型丧失安全对齐。

Oğuzhan Ersoy, Nikolay Blagoev, Jona te Lintelo, Stefanos Koffas, Marina... 2026-04-13
去中心化训练 后门攻击 大语言模型 安全对齐 流水线并行

筛选少量高方差用户提示,让 RL 提示优化在异质推理任务上突破全量训练瓶颈。

Zhaolin Gao, Yu, Wang, Bo Liu, Thorsten Joachims, Kianté Brantley, Wen Sun 2026-04-13
大语言模型 奖励方差分析 强化学习 推理任务 提示优化

DBCooker:基于LLM的数据库原生函数自动合成系统,三大模块协同覆盖声明解析、参考单元复用与自适应编排,在三大主流数据库上平均准确率提升34.55%。

Wei Zhou, Xuanhe Zhou, Qikang He, Guoliang Li, Bingsheng He, Quanqing Xu, Fan Wu 2026-04-10
代码生成 大语言模型 数据库系统 智能体 软件工程