用200名真实用户500天可穿戴数据出4084道10选1题,14个大模型最高仅72.9%
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
重思完整推理轨迹在后训练中的必要性
👍 17推理轨迹中段约20%是冗余的:SFT只保留首尾,效果反超完整轨迹训练
一个症状,三个杠杆:在策自蒸馏批判性综述
👍 14OPSD以自身加特权信息当教师,但不对称也扭曲信号,可用三个杠杆治理坍缩。
归一化低秩适配(NoRA)
👍 37沿秩维度归一化LoRA下投影矩阵,零额外参数即可加速收敛、提升性能与稳定性
英语监督的提示压缩器在非英语语言上失效,根源在训练监督而非架构
通过有界价值头、蒙特卡洛目标与长度自适应GAE,让单样本Critic强化学习稳定媲美GRPO
批判性评估圣训计算在LLM时代的真实进展、结构性缺口与五大研究议程
面向大模型持续改进的经验链
👍 9让LLM在测试时通过迭代反馈积累经验,无需训练即可持续提升
化学合理性感知的单步逆合成大语言模型训练
👍 33Top-K提示+化学合理性奖励训练出超越传统模型的大语言模型逆合成系统
自适应长度离散部件令牌+长上下文自回归,部件级3D生成扩展至300部件、256k令牌
验证器诱导的在线策略优化支持重塑
👍 5RLVR 在提升当前任务的同时,会把未来任务的成功轨迹挤到固定预算内难以采样
首次揭示混合线性注意力LLM中巨激活的前尖峰与平台形态,并用取消时机统一解释
指令微调令模型更自信但准确率未必提升,推理文本多样性变化方向不一
缓解英译罗机器翻译中的性别偏见
👍 9用LLM性别分类加标签感知翻译模型的混合流水线,把英译罗性别准确率提升40个百分点以上
用输入生成的幂律正算子替换注意力的固定双线性形式,训练后坍缩为可缓存的常量算子。
离线缓存教师Top-K对数几率并融合分块KL损失,让蒸馏显存随序列长度线性增长。
用When/Where/How三轴框架重定义大模型时代的持续学习
用技能熵度量技能切换难度,构建Skill2-Bench基准并用Skill-Entropy RL训练
当教师误导时:伪信号感知的在线策略蒸馏
👍 22过滤在线蒸馏中既不依赖输入又高影响的虚假教师信号
LG 升级再造 K-EXAONE,构建 750B 总参/37B 激活的 MoE 多语言基础模型。