用可学习前瞻 token 和轻量 LoRA 预测未来注意力重要性,实现零开销高效 KV 缓存驱逐
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用 Task Vector 表征口音方向,通过缩放与组合实现细粒度口音强度控制和混合口音合成
通过低秩旋转建模权重方向变化,将多步扩散蒸馏为高质量单步生成器,参数效率提升10倍。
通过强化学习训练路由器,解决LoRA混合模型中路由权重塌陷问题
用上三角矩阵W把图像特征几何变换后再与文本匹配
用可验证物理奖励和LoRA微调小型推理模型求解梁静力学,发现模型学到程序模板而非物理方程
ROSA2 提出词与权重的联合优化框架,将多轮测试时策略适配的准确率提升30%并减少40%对话轮次。
用Dynamic LoRA提升少数民族语言OCR性能39%-66%
用 LoRA 权重基底跨越视觉类比空间
👍 13提出 LoRWeB,通过可学习的 LoRA 基底和动态编码器组合,实现对未见视觉类比任务的泛化编辑。
通过识别和聚类安全相关神经元,实现高效的后置安全对齐,大幅减少训练参数并保持模型能力。
通过梯度归因定位安全关键神经元并进行聚类微调,在极少参数下显著提升代码安全性
用模型自身参数初始化旁路FFN记忆,实现高效测试时训练
系统性评估9种LoRA变体,发现适当调参后原版LoRA性能与变体相当
将权重微调、LoRA 和激活引导统一为动态权重更新,揭示偏好-效用权衡规律
CLARE通过轻量级适配器和自编码器路由实现机器人VLA模型的持续学习,避免灾难性遗忘
通过码本压缩和在线重置机制,将LLM持续学习的记忆库存储缩减至基线的0.3%
大型语言模型微调中的人工纠缠
👍 5从量子纠缠视角分析LoRA微调的内部参数结构与外部注意力表示,揭示注意力机制的‘无毛’特性。
动态分配专家LoRA秩,基于路由频率和梯度重要性提升MoE微调效果
双分支融合Prithvi与CNN,仅45.5M参数实现洪水制图SOTA