插入对角矩阵P,让单个LoRA适配器在所有子秩上同时学习层级特征。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出BR-MoE双层路由MoE机制,把PTM-based类增量学习首次扩展到300+非重叠任务。
在Ego-Exo4D上用三套参数高效方法把多视角动作熟练度估计推向生成式反馈
为LVLM设计并行PVM模块,缓解长序列生成中的视觉信号衰减
语义聚类指导的分布感知采样,DoRA+持续学习缓解跨语言负迁移
用 RDP 算法把隐藏态当成几何轨迹,挑选关键层做稀疏 LoRA 微调
诊断 LoRA 合并干扰集中在 B 矩阵,提出 B 空间预校准方法 Pico。
用一阶 Taylor 展开精准识别 MLLM 中语言特异与跨模态共享神经元,仅微调关键子集实现图像翻译 SOTA。
用合成数据集 + LoRA 微调让 DINOv2/DINOv3/RADIO 等纯视觉基础模型在零样本异常检测上首次反超 CLIP 类方法。
冻结 MoE-LoRA 栈 + 零空间投影 + 经验路由,发现适配器实际编码可迁移的认知原语。
通过仅优化初始循环状态实现零推理开销的高效模型微调方法
通过token级路由漂移分析与漂移感知的动态MoE扩展,解决VLM持续学习中的灾难性遗忘
307M参数的土耳其语掩码扩散语言模型,媲美数倍大的自回归模型
仅调约102个缩放参数,用进化策略校准 DiT 各模块权重,即可显著提升生成质量并加速推理
通过因式分解范数和融合 Triton 内核,解决 DoRA 高秩配置下的内存和效率瓶颈
LoRA2让每个LoRA组件自适应学习最优秩,在保持生成质量的同时大幅降低内存消耗
通过零初始化低秩残差适配器,在冻结的 ViT 上实现参数高效迁移学习
通过LoRA和超图神经网络高效适配通用医学视觉语言模型
通过异构归纳偏置和压缩瓶颈结构,实现视觉-语言模型的高效少样本适应
首次在原生3D空间实现骨架精确控制的轻量级生成框架