找到 448 条结果

从量子纠缠视角分析LoRA微调的内部参数结构与外部注意力表示,揭示注意力机制的‘无毛’特性。

Min Chen, Zihan Wang, Canyu Chen, Zeguan Wu, Manling Li, Junyu Liu 2026-01-13
参数高效微调 大语言模型 矩阵乘积态 纠缠熵 量子信息

基于Megalodon改进的Gecko架构,通过滑动分块注意力和自适应工作记忆实现4M长序列建模

Xuezhe Ma, Shicheng Wen, Linghao Jin, Bilge Acun, Ruihang Lai, Bohan Hou,... 2026-01-13
大语言模型 序列建模 注意力机制 线性注意力 长上下文建模

用分子结构类比Long CoT,揭示三种推理键的稳定分布决定学习成败

Qiguang Chen, Yantao Du, Ziniu Li, Jinhao Liu, Songyao Duan, Jiarui Guo,... 2026-01-12
大语言模型 强化学习 思维链 蒸馏 认知科学

动态分配专家LoRA秩,基于路由频率和梯度重要性提升MoE微调效果

Guanzhi Deng, Bo Li, Ronghao Chen, Xiujin Liu, Zhuo Han, Huacan Wang, Lijie... 2026-01-12
LoRA 动态秩分配 参数高效微调 大语言模型 混合专家模型

搜索增强LLM存在过度搜索问题:不必要的搜索调用增加成本并损害拒绝回答能力

Roy Xie, Deepak Gopinath, David Qiu, Dong Lin, Haitian Sun, Saloni Potdar,... 2026-01-12
大语言模型 工具使用效率 拒绝回答 搜索增强生成 检索增强生成

通过熵驱动潜在分支和信息瓶颈正则化,解决大语言模型推理中的探索崩溃问题

Huilin Deng, Hongchen Luo, Yue Zhu, Long Li, Zhuoyue Chen, Xinghao Zhao,... 2026-01-12
信息瓶颈 大语言模型 强化学习 探索利用平衡 推理优化

利用token级熵作为门控机制,区分不确定性学习与知识冲突,在保持领域适应性的同时缓解灾难性遗忘。

Muxi Diao, Lele Yang, Wuxuan Gong, Yutong Zhang, Zhonghao Yan, Yufei Han,... 2026-01-08
大语言模型 模型微调 灾难性遗忘 熵门控机制 领域适应