用PRM引导的MCMC式推理优化DeepThink系统
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
手术式后训练:剪除错误,保留知识
👍 12通过最小化编辑的数据修正和奖励二分类损失实现高效推理注入且避免灾难性遗忘
将LLM的softmax分类器重新解释为能量模型,通过检测能量溢出来识别幻觉
用智能体进化合成面向不规则并行数据的高性能代码,平均加速106倍
提出INSIGHT方法通过贝叶斯加权互信息优化RLVR训练数据选择
基于参考引导微调在强化学习中学习困难问题
👍 13通过参考引导微调(ReGFT)合成模型自有推理轨迹,解决RL训练中的奖励稀疏问题
提出基于置信度的递归推理框架,让模型自我修正提升精度
提出RLAD框架,通过信任区域比率蒸馏将教师指导嵌入GRPO更新,实现选择性模仿
首个针对软件工程的上下文学习基准,定义四种上下文类型并评估其对代码生成、摘要、审查和补丁评估的影响
通过并行证据采集替代顺序推理,实现高效且泛化的长期智能体搜索
ACE通过非对称惩罚过自信错误,在不损失Pass@1的前提下显著扩展推理边界
首个将金融推荐从行为模仿转向效用对齐的多视角对话式纵向评估基准
高效推理的艺术:数据、奖励与优化
👍 7系统研究高效推理训练机制,通过数据、奖励和优化策略实现更短、更准确的推理链生成
提出反思式测试时规划框架,让具身LLM在部署时通过三种反思机制从失败中学习
基于提示优化自动学习不同场景的隐私-效用权衡策略
通过算子级抢占和事件驱动调度解耦抢占粒度与调度频率,解决 LLM 服务中长请求导致的头部阻塞问题。
用协同演化世界模型替代进化启发式,引导LLM进行GPU内核优化搜索
变分推导闭式重要性权重核,64×陈旧下稳定LLM训练
提出统一优化框架解释所有解码策略,并设计新的Best-of-K采样器提升多样本生成质量
提出 NAMO/NAMO-D 优化器,将 Adam 的噪声自适应机制融入 Muon 的正交化动量框架