用人类把关的自我进化循环把医疗后训练变成数据配方搜索问题。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
百万级PR实证研究:LLM/Agent代码审查的采纳实践、协作模式与质量权衡
把完成轨迹的事后技能蒸馏回策略,实现自进化密集监督。
现代智能体系统中的自我改进:综述
👍 29把自我改进智能体形式化为参数更新与脚手架更新两条路径,统一梳理历史、分类、应用与评估。
提出可演进知识边界概念,用搜索智能体协同训练突破图像生成的世界知识瓶颈
通过双上下文状态实现低延迟、高效率的长视频理解
通过智能体代码审查将AI生成的PR从开环转为闭环
通过利用LLM评分token的完整分布实现细粒度反馈的通用验证框架,在多个领域达到SOTA性能
通过上下文空间和参数空间双重蒸馏,将大模型的过程式记忆能力迁移到小模型,实现边缘设备部署
为智能体RL的每个动作片段判定语义角色,按角色修正GRPO信用分配
通过扩展智能体视野和领域路由蒸馏,35B模型达到万亿参数性能
用于评估通用终端使用代理能力的基准测试平台
通过多轮自适应检索和强化学习优化,显著提升KB-VQA任务的准确率
提出智能体数据裁剪框架,将高熵原始多模态流转换为意图对齐的结构化训练数据
为动态环境中的计算机使用代理提供安全技能学习与重用框架
提出CoD框架,用RL训练LLM获得长生命周期智能体的元能力
提出智能体应辅助而非替代因果发现,开发causal-learn+平台保持算法核心完整性
通过显式账本和策略门解决工具调用智能体的状态跟踪和策略遵从问题
利用奖励方差检测能力边界,动态合成高质量多轮工具使用训练数据
首个端到端游戏生成基准,评估AI智能体在真实游戏引擎中构建完整可玩游戏的能力。