提出Principia基准和RLLM、ParaGator方法,显著提升LLM推导复杂数学对象的能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
用混合奖励机制修复QE模型漏洞,大幅提升低资源语言翻译质量
持续元学习框架,让LLM智能体通过技能注入和空闲期RL实现零停机进化
提出Chain of Events范式,通过构建时序事件链提升MLLM的视频事件预测能力
受神经科学互补学习系统启发,通过经验提取器与策略演员的协同进化实现高效经验驱动的智能体强化学习。
在线学习+不确定性引导探索使RLHF数据效率提升10-1000倍
用强化学习学习可迁移的逐层位宽分配策略,实现比统一4位量化更优的精度-效率权衡
将RL作为分布收缩算子,在预训练生成式策略基础上实现稳定高效的长周期机器人操作技能微调。
系统性研究LLM中间训练设计选择,揭示其与RL协同提升推理能力的机制
通过agentic mid-training和验证推理提升长链推理,BrowseComp达88.2
语言模型的在线经验学习
👍 60提出OEL框架,让语言模型从部署经验中持续自我改进
通过四阶段交互协议和双轨GRPO训练,让LLM自主探索未知数据库并生成准确SQL
边缘设备上的高效推理
👍 22通过LoRA适配器、动态路由和预算强化学习,在移动设备上实现高效LLM推理。
引入链式思维推理与多任务多奖励RL优化SVG生成
用强化学习将视频MLLM转变为主动评论者,实现机器人任务进度精确估计和零样本故障检测
多模态AI智能体的前瞻性规划
👍 3两阶段RL框架训练多模态Agent前瞻性规划能力,在7个基准上显著提升长视界任务性能
通过策略驱动的技能选择与分层奖励实现数学推理能力的持续进化
通过上下文化和去重模块改进Search-R1,EM提升5.6%,检索轮次减少10.5%
AI可以学会科学品味
👍 431用大规模社区反馈强化学习训练AI判断和提出高影响力研究想法
物理闭环双向优化,实现仿真就绪的人-场景交互重建