用信息匹配的锚点修复在线自蒸馏中师生信息不对称导致的特权幻觉。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过反向KL分解,把演化上下文作为在线监督信号注入蒸馏目标。
用差分激活定位偏见神经元,零化至多40个即可解耦偏见与能力
单一策略在任务序列中边解题边整理技能文档,实现端到端的可迁移技能学习。
3B参数把内容审核统一成yes/no问答,策略自适应且刷新多模态SOTA
Kimi K3:开放的前沿智能
👍 431首个开源3T级原生多模态MoE,配1M上下文与多档强化学习
面向大模型强化学习的预测性散度掩码
👍 10用散度方向导数重定义信任域方向判据,改进LLM强化学习稳定性。
基于超网络的大语言模型知识注入的缩放定律
👍 16首次系统刻画超网络知识注入的幂律缩放,目标模型缩放收益最大且OOD泛化优于微调
在开源Gemma模型中读出材料科学概念、追踪本构取向的状态变换并因果调控工程决策
提出3D-Fit基准,评测LLM在多重3D空间约束下的分子生成能力
把 LLM 裁判升级为教练,用可迁移经验知识替代标量奖励训练模型。
用2026世界杯104场比赛,细粒度评测大模型与智能体的赛前足球预测能力。
记忆中枢+语义ID+隐式推理,让LLM低成本驱动淘宝推荐
三组件架构(分词器+LLM+渲染器)实现可控高保真歌曲与翻唱生成
用全概率公式检验 LLM 估计的统计自洽性,发现宏观谬误等系统性违反
首个迭代式组件级 RAG 框架,将法规描述转为可执行 Scenic 场景脚本
一条文本提示一键生成门户连通、可互相穿行的多场景3D游戏工程
大语言模型中的元认知:基础、进展与机遇
👍 24首个系统综述:LLM 元认知的测量、赋予、应用与未来方向
信任区域策略蒸馏
👍 32通过动态构造近端教师解决OPD优化不稳定性,零计算开销实现数学推理性能大幅提升
引入梯度协方差改进PTQ,在2-bit量化LLaMA-3-70B上达7.93困惑度