首个将心智理论(ToM)引入学术反驳的框架,通过建模审稿人心态生成策略性回复
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
提出RPE复杂度度量和逆向QA合成框架,生成大规模高难度图表推理训练数据
提出PaST框架,通过正交的参数更新将RL技能注入SFT模型,解决知识与推理的脱节问题
提出自进化循环框架,通过可验证合成引擎和大规模沙盒交互训练计算机使用代理
沙箱中的大语言模型:激发通用智能体能力
👍 87通过代码沙箱环境激发LLM的通用智能体能力,实现跨领域性能提升
扩散语言模型的任意顺序生成反而限制推理,用标准GRPO效果更佳
测试时强化学习训练LLM,在单个科学问题上发现新SOTA
SAMTok:用两个词表示任意掩码
👍 44将任意区域掩码压缩为两个离散token,让MLLM像学语言一样学像素级能力
大语言模型时代的自动内核生成综述
👍 19系统综述LLM和智能体驱动GPU内核自动生成的方法、数据与基准
强化智能体模型中的行为知识合并
👍 27提出RAM方法解决RL训练智能体模型合并时的信号稀释问题,实现跨任务协同增强
结合LLM全局推理与RL局部决策的分层自主探索框架,在仿真和真实环境中显著提升探索效率
提出课程引导的强化学习框架,联合优化多语言医疗推理的逻辑正确性与语言一致性
Think3D:用空间思考来实现空间推理
👍 48让VLM通过主动探索3D点云空间进行推理,而非被动接受2D图像
1B参数VLM在OCR基准上超越9B模型,支持图像定位与高效推理
提出ToolPRMBench基准,系统评估工具使用代理的过程奖励模型,覆盖多种工具环境和错误类型。
提出可控视觉轴解耦的2D平台环境,系统评估RL智能体的视觉泛化能力
通过模型自我验证和提出单步纠正干预,解决强化学习在LLM推理中的信用分配问题
通过采样多个token并聚合为连续表示,实现随机且高效的推理过程。
揭示RLVR通过Anchor-Adapter电路激活LLM记忆捷径而非真正推理
你的群组相对优势是有偏的
👍 158揭示GRPO等群组相对RL算法中优势估计的固有偏差,并提出HA-DW自适应修正方案