结合LLM全局推理与RL局部决策的分层自主探索框架,在仿真和真实环境中显著提升探索效率
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出课程引导的强化学习框架,联合优化多语言医疗推理的逻辑正确性与语言一致性
提出「定位-引导-改进」框架,将机制可解释性从观察科学转变为可行动的干预方法论
首个系统评估奖励模型判断LLM长期记忆管理能力的基准,揭示开源与闭源模型差距缩小
成员推理攻击在语义保持的改写下会失效,不足以作为版权审计的可靠证据。
将提示优化建模为POMDP,用五角色多智能体协作提升心理健康情感诊断准确性与鲁棒性。
通过采样多个token并聚合为连续表示,实现随机且高效的推理过程。
揭示RLVR通过Anchor-Adapter电路激活LLM记忆捷径而非真正推理
解锁隐式经验:从文本中合成工具使用轨迹
👍 39提出从文本语料库直接提取多轮工具使用轨迹的新范式,绕过对预定义工具的依赖
揭示个性化LLM中因表征纠缠导致的事实幻觉,提出FPPS推理时干预框架
利用token预测概率识别核心语义,选择性训练高概率token提升SFT效果
通过奖励LLM生成的罕见但正确的解题策略,解决强化学习中的探索崩溃问题。
在GRPO优势之后加反向累积log比,修正自回归KL信用分配
首个大规模研究AI Agent技能安全漏洞,发现26.1%技能存在安全隐患
系统评估少样本、思维链等提示工程技术对LLM情感分析性能的影响
基于Gemma 3的开源翻译模型,SFT+RL双阶段训练大幅提升质量
利用熵作为自触发信号,在交互过程中动态生成步级经验指导,显著提升网页智能体推理能力
系统综述大语言模型中的记忆机制,构建隐式/显式/智能体记忆三层分类体系
通过规划阶段分支策略和多样性奖励提升LLM创意写作多样性
两阶段训练:先学判断再学生成,提升推理效率