将文本技能转化为LoRA适配器,实现高效模块化的LLM代理技能系统
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
同时更新agent scaffold和权重的自改进系统
LoRA 联合训练实现按输入类型自适应跳过层
提出三轴框架,通过PEFT在万亿参数基础模型上构建百万个人模型实例
将50个视觉效果LoRA蒸馏到单一模块,解决部署成本和特征干扰问题
将外部记忆转化为参数化技能的具身智能体记忆框架
重新思考VLA初始化中的VLM表征设计
👍 15系统研究VLM表征如何影响VLA初始化,提出能力-更新-动作三轴设计原则
Retinex 插值连续伪配对 + 边缘加权 Flow Matching,实现可控低光增强。
用低秩截断与补偿,免训练保护基础模型与LoRA,授权端无损恢复。
在AdamW优化器之上加有界自治控制治理层,压力学习率下保稳定与提速。
商业检测器把base模型续写判为人类,HIP用迭代改写绕过检测
用学习的记忆控制器为冻结 GUI 基座插拔式注入多模态工作与情景记忆
把 LoRA 适配器当作可管理策略单元,让 1T 级别基座模型承载百万级策略目录。
用 Adafactor 对角 Kronecker 预条件子解决 LoRA 因子空间算子奇异性
首次系统分析 Adam 与 Muon 的优化器错配问题,证明 LoRA 可让 Muon 在微调阶段匹配甚至超越 Adam。
提出可查询低秩更新记忆库,用指令正则化路由替代静态LoRA
插入对角矩阵P,让单个LoRA适配器在所有子秩上同时学习层级特征。
RL 只在 1-3% 高熵分叉点重排序,REASONMAXXER 无需 RL 即匹敌完整训练
用 TTS 合成实体密集音频 + LoRA 微调,17× 提升泰卢固语 ASR 实体识别率
基于视频扩散先验的统一框架,单模型支持15种像素对齐任务的文本/视频间多模态生成。