验证门控智能体框架:LLM 生成的 PLC 逻辑须经规范、编译与实机三重外部验证方可交付
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
单一模型自博弈:既写可执行训练环境又解题,环境难度随能力共同进化,实现持续自我提升。
用进化策略替代反传式RL,以推理级显存全参数微调长程智能体,且horizon越长优势越大
善用记忆:记忆智能体中记忆基底的全面评估
👍 15受控评估11种记忆基底:无单一基底全胜,需按任务体制动态路由
把智能体执行轨迹建模为依赖图并传播不确定性,实现长程任务失败的早期检测。
提出个性化自动科研问题,让AI科研系统全程感知并适配研究者个体
联合设计面向LLM的DSL与多智能体系统,用空间关系算子取代脆弱坐标,实现可靠3D创作
大型发现模型:经验校准的开放式科学搜索
👍 62LLM提议候选、高斯过程校准不确定性,采集函数统一调度推理算力与昂贵实验,实现跨域科学发现
把黑盒智能体框架当作不透明环境,用沙箱、服务代理与前缀树实现稳定的智能体RL
用144对物理突变任务检验智能体改代码自救的能力,揭示机制重设计而非参数推断是真瓶颈
把数据库ACID事务语义引入LLM智能体,KramaBench得分提升10.6%
理解智能体AI系统中的认知诱发风险
👍 17按物理、社会、自指三级认知框架系统分析智能体AI对人类能动性、自主性与控制力的风险
共享预算评测显示,LLM竞赛成绩在72格中71格低于其单题能力的离线最优分配
AI科学家不该只当自主工具研究,而应以人-智能体系统为单位促进人机协同
在ReAct行动-观察空闲窗口并行分支推理,不加关键路径即可减回合、省解码、保精度
将逐轮记忆整合改为语义分段批量编码,准确率与构建成本双优
将技能库压缩为保契约的可逆宏图,按任务水合最小可执行上下文
NCP-Bench 揭示:最强 LLM 叙事代理 20 轮后存活率仅 42%,长程承诺保持未解决
以跨任务与跨谱系的比较证据改造自修改算子,Polyglot 成绩从50.8%升至93.2%
把技能视为类型化契约,用最短忠实解释实现免评估、保稀有的技能压缩