两阶段框架:检索增强原型生成+GRPO片段优化,实现分子多属性精确控制
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过逻辑结构化数据构建和感知结构的奖励聚合,显著提升LLM复杂指令遵循与逻辑推理能力。
在GRPO优势之后加反向累积log比,修正自回归KL信用分配
通过规划阶段分支策略和多样性奖励提升LLM创意写作多样性
通过策略与评论家的协同进化,解决强化学习中评论家过时导致反馈失效的问题
首个用强化学习优化文本到可视化生成的框架,通过多目标奖励提升图表质量
提出自进化框架Dr. Zero,无需数据即可训练强大搜索智能体
用MTQE模型作为GRPO强化学习的奖励函数,训练LLM更好地翻译习语,同时提升通用翻译能力
通过解耦多奖励归一化解决GRPO信号坍塌问题,提升RL对齐效果
让小模型主动调用大模型,用1.07%的token成本恢复60%性能差距
通过合并低熵去噪步骤为高熵SDE步骤,提升流模型GRPO训练效率
通过门控自适应正则化和多样性感知优化,解决扩散模型RL微调中的奖励作弊问题