通过合成可控难度的推理环境和自适应RL,持续提升LLM推理能力。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
Upstage 102B 韩英双语 MoE 模型,合成数据+SnapPO 突破低资源瓶颈
用组内锦标赛排名替代逐点标量打分,解决开放式任务RL训练中的判别力崩溃问题
揭示工具使用智能体的置信度二分法,提出CAR框架缓解校准偏差
首个用强化学习优化文本到可视化生成的框架,通过多目标奖励提升图表质量
融合自适应思维链与语言记忆的VLA导航模型,在多任务基准上达到SOTA并零样本迁移到真实机器人
两阶段训练:先学判断再学生成,提升推理效率
并行协调推理框架突破上下文限制,8B模型超越GPT-5
用完全合成数据训练7B代码模型,在竞赛编程基准上超越14B真实数据模型
提出NoisyBench基准测试,揭示推理模型在噪声上下文下性能骤降80%,并提出RARE奖励函数提升鲁棒性
提出 SteeM 框架,让用户动态控制 AI 对历史记忆的依赖程度,解决记忆锚定问题
提出自进化框架Dr. Zero,无需数据即可训练强大搜索智能体
通过自演化数据飞轮和两阶段行为校准训练,系统性纠正LLM智能体的工具使用错误模式
多智能体竞争共识+门控RL,解决旅行规划中多目标冲突与约束满足难题
提出模块化RLaaS框架,通过关注点分离实现可扩展的多智能体RL训练
证明SFT和RL在后训练中相互耦合,顺序执行必然导致一方退化
揭示链式思考推理在细粒度视觉分类中的'思考代价'现象,提出ReFine-RFT框架实现最优性能
用MTQE模型作为GRPO强化学习的奖励函数,训练LLM更好地翻译习语,同时提升通用翻译能力
用地图思考:强化并行地图增强智能体的地理定位方法
👍 171让大模型像人类一样使用地图工具进行图像地理定位,通过强化学习和并行测试时缩放提升精度
思维的分子结构:长链推理的拓扑映射
👍 60用分子结构类比Long CoT,揭示三种推理键的稳定分布决定学习成败