通过识别并移除prompt中的干扰token,提升RLVR训练的采样效率和推理性能
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
Actor-Refiner协作框架解决搜索推理中的多尺度信用分配问题
COBALT方法通过上下文赌博机学习结合在线和离线RL,提升多轮代码生成性能。
模拟放射科医生先扫视后聚焦的诊断策略,用强化学习筛选CT子体块,实现泛癌种高效精准筛查
视觉语言模型中的上下文视觉个性化
👍 3提出CoViP框架,通过个性化图像摘要和强化学习实现上下文视觉个性化
通过多轮强化学习训练MLLM自主调用分割工具,实现超越人工提示的医学图像分割
多模态联合训练+Agent Swarm并行编排,实现通用智能体
多尺度视觉裁剪+长程轨迹RL,突破多模态深度研究瓶颈
自动构建80万+多语言SWE可验证环境,用于训练编程智能体
通过闭环优化同时优化环境、策略和奖励模型,实现LLM代理任务的显著提升
面向多模态大语言模型的认知超感知
👍 16用视觉想象链增强MLLM的认知推理能力
Rubric-ARM通过交替强化学习联合优化评分标准生成器和判断器,提升LLM后训练效果
大语言模型中的稀疏奖励子系统
👍 13发现LLM隐藏状态中存在稀疏的奖励相关神经元子系统
用强化学习训练LLM进行分治推理,在竞赛级数学任务上超越链式思维推理
基于旅行规划场景构建长程多轮交互基准,揭示现有LLM在复杂约束下的严重不足
通过隐式潜在推理无缝集成到自回归图像生成中,实现高效自精炼。
将语言模型作为可训练的提示词优化器,与流匹配模型联合强化学习,解决探索坍塌与提示词过拟合
通过测试时缩放和强化学习训练生成器,实现可控难度的高质量推理问题合成
OVD:在策略语言蒸馏
👍 6用离散语言分数替代token级概率匹配,实现内存高效的推理能力蒸馏
轻量级生成式提示预测模型实现跨提示难度泛化,加速RL后训练