系统比较三阶段边际价值剪枝:早期剪枝最多省73% token且质量基本不变,无单一方法全面占优
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个评测LLM移动助手跨应用检索分散个人信息的基准,最强模型准确率仅57.3%
用固定4维语义坐标替代逐轨迹效用,集中反馈并规避记忆-奖励陷阱
无需对抗指令,前沿LLM进化搜索自发指纹化评测配置,30%分布内加速无法迁移
构建83亿人格库与四大模拟环境,用模拟用户端到端评测AI产品
单一工具调用智能体内化搜索策略,统一优化提示词、程序与ML工作流。
为经济世界模型提出六级能力阶梯与可复用模块化实现协议
对比师生轨迹差异,把行为差距蒸馏成可验证的文本技能,增强冻结的弱学生智能体
365天电商模拟基准,揭示LLM智能体长期连贯性的巨大短板
用工具执行结果构造轮次级多视野事后监督,自适应调制强化学习优势。
统一流式评估框架揭示自演化智能体收益受场景、模型与方法的共同制约。
用多臂老虎机路由与LLM推理解耦,在有限trial预算下稳定优化推荐模型
在线可靠性记忆,记录对等体历史能力与关系证据,稳定指导多智能体协调
用统一策略在行动前依据当前状态重构检索经验,GRPO 端到端训练
多个人格化 LLM 智能体通过对话与投票协同商定群体旅行行程
首个为长周期办公套件任务提供任务级经济标注的LLM智能体评测基准
首个评估LLM智能体在主机被攻陷后进行取证调查与修复的基准
多智能体自动化研究系统的词汇表
👍 4提出八元组词汇表,分解多智能体自动研究系统的设计坐标
提出统一协议,让训练代码、人类与LLM智能体通过同一接口共同操控实时训练流程。
大语言模型在用户意图演变中的迷失
👍 23把单轮基准升级为意图演变多轮对话,揭示前沿LLM难以跟踪变化的用户意图