通过算法强制执行残差层级结构,解决2-bit量化中的路径共适应问题
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出SeeUPO算法,通过逆序顺序更新解决多轮智能体RL的收敛性问题
学习大语言模型激活的生成式元模型
👍 4用扩散模型学习LLM激活分布,作为先验提升引导干预和可解释性
用结构化表格管理搜索状态,统一解决深度/广度/深广混合信息搜索
将多教师LLM的知识通过五种净化方法整合为单一推理链,缓解冲突并提升蒸馏效果
量化后LLM偏见变化由不确定性驱动,聚合指标掩盖21%响应翻转
通过长度归一化消除GSPO的长度偏差,提升RLVR训练稳定性和性能
提出多轮强化学习框架解决内核生成中的奖励作弊和懒惰优化问题
ProAct:交互环境中的智能体前瞻推理
👍 27通过蒸馏MCTS搜索树和蒙特卡洛评论家,让LLM智能体内化准确的前瞻推理能力
900万数学定理的语义搜索
👍 22构建920万数学定理语料库并实现语义检索系统,在专业数学查询上显著优于现有工具。
提出可学习的潜在记忆框架,通过角色感知的潜变量优化解决多智能体记忆同质化和信息过载问题
多任务GRPO:跨任务的可靠LLM推理
👍 14提出MT-GRPO算法,通过自适应任务加权和比例保持采样实现多任务推理的均衡优化
BABE:生物学实验推理能力评估基准
👍 10基于真实论文构建的生物学实验推理基准,评估LLM因果推理能力
提出可动态切换文本/视觉/交错三种推理模式的混合自回归多模态推理模型
利用小型预训练模型的晚期表示来引导大型模型的早期训练,实现1.6倍加速并提升5%性能
系统性评估9种LoRA变体,发现适当调参后原版LoRA性能与变体相当
用 KL3 估计器替代 GRPO 中的对称裁剪,实现有理论保证的非对称近信赖域约束
将LLM多智能体推理从个体层面提升到集群层面,通过神经符号融合实现可扩展、校准良好的群体动态模拟
首个从长篇科学文本自动生成出版级科学插图的智能体框架与评测基准
通过ROM存储扩展LLM容量,实现零延迟开销的端侧模型性能提升