通过联合优化推理准确率与置信度校准,解决迭代自训练导致的模型过度自信问题
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过正交几何基统一运动码本与LLM嵌入空间
并行协调推理框架突破上下文限制,8B模型超越GPT-5
多智能体竞争共识+门控RL,解决旅行规划中多目标冲突与约束满足难题
提出模块化RLaaS框架,通过关注点分离实现可扩展的多智能体RL训练
大型语言模型微调中的人工纠缠
👍 5从量子纠缠视角分析LoRA微调的内部参数结构与外部注意力表示,揭示注意力机制的‘无毛’特性。
证明SFT和RL在后训练中相互耦合,顺序执行必然导致一方退化
LLM确定性推理抑制涌现、破坏推理、制造安全假象,应拥抱分布变异性。
自洽性对推理忠实性的影响因模型而异,并非普遍有益
基于Megalodon改进的Gecko架构,通过滑动分块注意力和自适应工作记忆实现4M长序列建模
思维的分子结构:长链推理的拓扑映射
👍 60用分子结构类比Long CoT,揭示三种推理键的稳定分布决定学习成败
本文系统研究偏好调优在域偏移下的泛化和多样性,发现伪标签提升性能但导致多样性崩溃。
通过双层信用评估和查询优化机制,显著提升搜索代理的中间查询质量与整体性能
动态分配专家LoRA秩,基于路由频率和梯度重要性提升MoE微调效果
搜索增强LLM存在过度搜索问题:不必要的搜索调用增加成本并损害拒绝回答能力
提出推理驱动的多智能体路由器,支持动态加入Agent和多Agent协作执行
通过熵驱动潜在分支和信息瓶颈正则化,解决大语言模型推理中的探索崩溃问题
熵自适应微调:解决置信冲突以缓解灾难性遗忘
👍 115利用token级熵作为门控机制,区分不确定性学习与知识冲突,在保持领域适应性的同时缓解灾难性遗忘。
首个端到端分子动力学代码生成与QA框架,结合三阶段训练与闭环强化学习
小米309B参数MoE模型,混合滑动窗口注意力+多教师蒸馏,推理提速2.6×