通过医生验证的rubric和可复用临床原则实现医疗LLM精细对齐
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
在RL训练中嵌入经验-反思-整合循环,使语言模型通过显式自我反思将环境反馈转化为持久行为改进
3B参数模型同时实现推理、编程和长程智能体能力
通过双约束任务合成、中训练与强化学习,打造高效长时程深度搜索智能体
基于1M+真实轨迹训练的开放网页世界模型,显著提升智能体性能
通过嵌入器引导的强化学习优化思维链,提升多模态检索嵌入质量
小红书团队通过系统优化数据工程与训练方法,实现开源SOTA指令图像编辑
提出统一后训练框架,通过SFT与多任务RL结合,大幅提升多模态扩散语言模型的推理能力
通过强化学习和任务特定奖励,统一人体运动理解与生成的多模态模型
通过异步批量推理框架将VLM语义知识蒸馏到轻量RL策略,实现实时自动驾驶
通过训练时区域蒸馏取代推理时工具缩放,实现单次前向传播的细粒度视觉感知。
结合人类专家CoT数据与地理相似性奖励,实现细粒度图像地理定位
通过拆解-干预-重组的弗兰肯斯坦框架,揭示 RL 真正改进的是中后层的视觉-推理对齐
RL+仿真交互+真实SFT锚定,提升VLA模型真实部署成功率
首个专门为CUDA内核生成设计的扩散大语言模型
通过动能正则化将最大熵RL重构为薛定谔桥问题,无需显式密度估计
通过将多个简单问题组合成复杂新题,解决RLVR训练中"全对"提示泛滥导致有效数据枯竭的问题
超越教师:基于奖励外推的泛化在线策略蒸馏
👍 68通过奖励外推实现超越教师的在线策略蒸馏框架
世界模型条件化强化学习,复杂操控任务成功率提升约30%。
用长度奖励+冗余惩罚打破LLM推理的浅层探索陷阱