系统评估混合推理LLM中三种思维模式切换策略在不同规模和任务领域的效率-有效性权衡
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
从NSF资助摘要中构建280万科学声明数据集,用于科学声明验证和提取研究
构建BONAFIDE基准证明主流CoT忠实性指标基本无效
用1300万条公交路径规划记录做持续预训练,让LLM端到端摆脱地图引擎直接生成合法路线。
把难题拆成可验证子问题序列,用子问题级信用分配强化LLM推理
基于MLLM的统一时尚检索框架,通过查询校准和自适应采样处理多样化检索任务
基于变分策略蒸馏的语言反馈学习
👍 12提出变分策略蒸馏(VPD)框架,通过EM算法让教师与学生协同进化,解决RLVR稀疏奖励问题
语言模型RLVR中的不可学习现象
👍 6揭示RLVR训练中存在反直觉的不可学习样例,代表模型表征的根本性缺陷。
首个关注密集干扰和长距离依赖的跨域记忆评估基准,现有系统平均准确率仅27.9%
通过对比对搜索实现目标神经元的精准调控
👍 17CNA:仅干预 0.1% MLP 神经元,将指令模型拒绝率降低超 50% 且保质量
用 Hölder 平均统一 GRPO 系列聚合方式,提出动态 p 退火。
用 LLM 先验从纯观测轨迹中归纳可执行 POMDP,摆脱对真实隐藏状态的依赖。
用Hodge分解提取MoE专家合并中不可约的高阶障碍,驱动学习自由压缩
用在线动态奖励权重与每题目标长度,兼顾正确性与简洁性
迈向递归自进化的智能体文献检索
👍 4PaSaMaster 通过递归自进化检索将复杂科研意图转化为可审计、可验证的论文排序列表。
揭示异步RL中旧logits缺失问题,提出精确获取与PPO-EWMA两种修复路径
大语言模型中的模型合并缩放定律
👍 44首次提出LLM模型合并的floor+tail幂律,量化专家数与模型规模的耦合标度
提出GCAD方法在注意力层而非残差流注入引导信号,缓解多轮对话中的KV缓存污染。
提出可查询低秩更新记忆库,用指令正则化路由替代静态LoRA
首个生成 token 的熵即可匹敌多采样自一致性幻觉检测