提出LLMA-Mem记忆框架,揭示多智能体系统中团队规模与终身学习的非单调扩展关系
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个系统评估人本智能体社交网络隐私风险的基准,提出"抽象悖论"揭示提示工程的局限
自主多智能体进化框架用于开放性发现
生成式多智能体系统中涌现的社交智能风险
👍 52首个系统性研究LLM多智能体系统中15种涌现社交风险的实证工作
揭示LLM生成优化三大隐藏设计决策如何决定成败,无通用解
通过持久记忆库和锦标赛式提示进化,无需微调即可大幅提升LLM多智能体博弈的胜率与稳定性。
预算感知树搜索框架BAVT,用更少资源实现更强推理
提出回顾性双重内在反馈框架,通过数值探索奖励和语言经验复用提升LLM智能体强化学习效果
首个基于持续集成循环的仓库级基准,评估LLM智能体在长期代码演进中维护代码质量的能力
用LLM智能体自动搜索能预测论文未来影响力的评分标准,再用该标准反向改写论文,人工盲评中79%更偏好修改版。
测试时拦截-纠正-拒绝框架,动态优化多智能体系统中错误信息的传播
通过四维策略梯度分析揭示ARL训练不稳定根源,提出SAMPO统一算法实现稳定训练
提出基于信息瓶颈原则的LLM智能体长期记忆框架,通过分层记忆和三通路检索提升推理性能。
将原始经验蒸馏为层次化技能库,并通过递归进化机制与策略共同优化
用演化算法对因子挖掘轨迹做变异与交叉,提升LLM生成alpha因子的质量与泛化性
面向 LLM 智能体的强化世界模型学习
👍 28用自监督 RL 训练 LLM 成为动作条件的世界模型,提升智能体决策能力
通过学习识别并省略冗余的思考和观察token,在不损失准确率的前提下大幅降低智能体推理成本
通过离线构建方法论知识图谱,将研究想法从模糊概念自动转化为结构化科学叙事。
通过层次化上下文管理、动量回溯和自适应协作进化,系统性解决LLM进化搜索的三大失效模式
受控自进化算法用于代码效率优化
👍 115通过多样化初始化、遗传进化和层级记忆三大机制,提升代码自进化搜索效率。