SKIM框架将LLM技能压缩为自适应多分辨率软token,平衡推理效率与任务性能
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出教学语言学和持续指令调优框架,显著提升低资源语言翻译质量
CPPO通过位置加权阈值和累积前缀预算解决LLM强化学习中自回归生成的不对称性
重新思考大语言模型强化学习中的散度正则化
👍 34提出DRPO方法,用平滑正则化替代硬mask,改进LLM RL训练稳定性
首个多数据集测试时提示学习框架,通过路由器减少跨数据集干扰
动态线性注意力
👍 10基于信息感知的自适应状态合并,提升线性注意力的长上下文建模能力
异构LLM集成实现分布式QD搜索,性能提升124%
Muon 因归一化方向锐度更低而获得更小的曲率惩罚
TRD通过轨迹级修正解决OPD前缀失效问题
提出心理学摘要实证关系图提取任务,构建数据集和分阶段LLM提取管道,实现macro-F1=0.74的图提取性能
你的解嵌入矩阵是文本嵌入的秘密特征透镜
👍 99揭示LLM解嵌入矩阵的隐藏子空间,提出线性变换方法提升零样本文本嵌入性能
提出 DistIL 算法,通过前向交叉熵和序列级信用分配解决自蒸馏方法的单调性缺陷
提出闭环交互式ASR框架和S2ER语义评估指标
首次将在线蒸馏提升到隐藏状态空间,解决方差瓶颈和信息压缩问题,实现Pareto优势
提出PROPME框架区分LLM记忆能力与倾向性,发现模型在对抗提示下可泄露训练数据但在日常使用中很少这样做。
基于归一化流的潜空间推理
👍 8用标准化流在LLM中建模连续思维链,保持自回归接口并支持策略梯度优化
提出反事实上下文修订框架审计LLM姿态模拟,发现多模态策略效果显著
ADR框架通过原子分解重组生成高质量可验证代码任务,突破RLVR数据瓶颈
提出融合音频、歌词、语义元数据和用户参与度信号的多模态音乐推荐框架,在LLaMA-3-70B等大模型上验证了多模态特征可提升Recall达95%、NDCG达79%
把推理步骤流式转发给下游智能体,既降延迟又提准确率