将真实CVE转化为可执行数据训练OpenAegis,CyberGym通过率达58.1%
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用经校验的工作记忆驱动技能调用,以结构化证据定位失败并定向演化记忆,实现冻结模型的递归自我改进
Metaⁿ:以涌现深度实现递归自我提升
👍 14固定元操作Ω并递归作用于其自身输出,构建深度自增长、角色涌现的自我提升智能体栈
算法专家智能体接力协作,用公开测试反馈逐步修复竞赛代码
语言交接会保留约束的语义内容,却悄悄剥夺其行动强制力,造成工作流状态传递失败。
用无超参方法把智能体轨迹压成小型FSM,统一支撑下一步预测、失败预测与运行时监控
不替换现有推荐流水线,用意图引擎+元引擎+双重奖励回路实现淘宝首页GMV提升1.31%
交互式有状态移动沙盒,四维评测移动规划智能体的工具调用与规划能力
用策略条件化分组消除开放式智能体RL中跨策略比较偏差
验证任务集随harness共同进化,用20%评测预算达到全量搜索效果
双阶段自主科研系统:机制洞见接地选题,独立证据评审杜绝幻觉结论
778个机器可验证长工作流任务证明验证器确认的执行经验Gene显著优于Skill
提出图工程范式,用任务、智能体、运行时三类显式图结构把单体智能体组织成系统智能。
首个把状态重建与 NPC 决策从视频生成中解耦的四层闭环游戏世界模型
匹配暴露实验显示信息流使LLM智能体词汇趋同,但四账号协同攻击无立场优势
用可插拔组件包裹静态环境,按策略弱点自动定制训练环境,显著提升智能体学习
把成功工作流在线编译为可调用技能库,以直接复用与上下文引导双路径实现训练无关的智能体自进化
Repo0:设计驱动的零到全仓库代码生成
👍 19用双DAG表示仓库架构状态,以模块度指标引导结构持续演化,从自然语言需求直接生成完整代码库
把领域政策编译成工作流图,在用户轮次边界持久追踪进度并主动修复智能体的流程违规
固定回复重放把匹配分数分解为传输损伤与契约补偿,揭示命令路径如何颠覆模型排名