大规模 AI 社交平台 Moltbook 虽有密集互动,但未出现人类式的社会化收敛。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个统一异步执行、时间推理、噪声鲁棒性、歧义消解与多智能体协作的可验证评测基准
三场景经济环境基准,揭示LLM长程决策中无单一模型全面占优的系统性瓶颈
强制思考会缩短回复、减少信息披露,反而降低交互式Agent表现
4万+ Agent Skills生态测量:爆发增长、冗余严重、供需错配、风险凸显
混淆NumPy库构建伪新知识域,诊断LLM智能体的知识内化与自进化能力
将记忆操作重构为可学习、可演化的技能库,通过闭环优化实现智能体自进化记忆管理
首个系统化LLM Agent不确定性量化框架与四大挑战分析
用MARL训练的多智能体系统,4B模型匹敌671B单智能体的广域信息检索能力
提出AUV/LR/MI三维指标诊断LLM智能体的交互优化效率、循环失败与记忆效用
层级检索接口赋能LLM自主决策,实现Agentic RAG范式突破
提出DDR-Bench基准,评估LLM在无预设问题下自主探索数据库并挖掘洞见的能力
发现状态信息丰富度和规划复杂度是 RL 训练保留跨域泛化能力的关键因素
大语言模型的智能体推理:基础·进化·协作
👍 207系统综述LLM智能体推理范式,涵盖规划、工具、搜索、记忆与多智能体协作
首个将学术rebuttal写作重构为证据驱动规划任务的多智能体系统
首篇系统综述LLM在SWE问题修复中的数据、方法与分析,涵盖175篇论文
LLM无需执行即可预测ML方案优劣,实现6倍加速并超越执行基线6%
SimpleMem通过三阶段流水线实现高效记忆管理