通过在历史序列上预先练习构建经验记忆,辅助 LLM 进行准确的长时程行为预测
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出FlashMorph,通过联合优化层间门控,高效选择混合注意力模型的全注意力层
基于Logit贡献评分的非字面检索头识别
👍 18提出LOCOS方法通过OV电路投影识别执行语义综合的检索头
通过gist token压缩+选择性展开实现无需架构修改的长上下文稀疏注意力
在分组查询注意力中引入稀疏路由,保持精度同时降低计算成本
头部级混合注意力架构,通过可解释性筛选关键头部,平衡计算效率与长上下文能力
重新思考混合架构中高效注意力的角色
👍 20系统分析混合架构中高效注意力对长上下文能力的影响机制
混合线性注意力+KPop RL+异步流水线,构建开放高效万亿智能体模型家族
MSA通过块级稀疏选择在109B模型上实现28.4×计算减少和14.2×预填充加速
通过多模态上下文推理框架和高效注意力机制,实现长视频理解与智能Agent能力
通过解耦预测投影实现CPU-GPU异步预取,提升稀疏注意力长上下文推理效率
发现CoT微调破坏混合模型长上下文召回能力,提出QK-Restore零训练修复方法
用神经记忆索引器预测关键 KV 块,将 GPU 内存消耗降至 13.5% 同时保持精度
大规模端到端上下文压缩
👍 27提出LCLM编码器-解码器压缩方法,在保持模型能力的同时大幅降低长上下文推理的内存和延迟
将RAT+的指数衰减记忆模块应用于Quest、MoBA、SnapKV等稀疏推理方法,大幅提升精度
MemTrain:自监督的上下文记忆训练
👍 17自监督双代理任务(端到端重建+中间记忆召回)预训练LLM记忆能力。
上下文管理效果取决于检索器-模型能力匹配度,呈现倒U型非单调模式
12B参数MoE模型,仅激活2.5B参数,实现代码生成和工具调用的IDE部署级效率
9.8B 激活参数的 MoE 大模型,通过 Agent 数据管线+Forge 强化学习系统+自我进化,在编码与办公 Agent 任务上比肩头部闭源模型
FP4 注意力中只对 5% 关键块保留 FP16,兼顾速度与质量。