通过解耦KV缓存为共享基缓存和低秩适配器缓存,实现多LoRA智能体系统的内存与计算双重优化
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用超网络动态生成LoRA权重,在推理时高效引导扩散模型生成轨迹朝向人类偏好对齐
用GPT-2小型代理模型的LoRA集成计算梯度信噪比,筛选高价值训练数据
利用token预测概率识别核心语义,选择性训练高概率token提升SFT效果
动态分配专家LoRA秩,基于路由频率和梯度重要性提升MoE微调效果
首个支持文本/风格图/首帧三种引导方式的统一视频风格化框架