← 前一天
2026-08-26
后一天 → 今日

用奖励梯度构造有界正负中间目标并在线自蒸馏拟合,把图像级奖励变成显式可诊断的监督。

Wei Zhou, Xiongwei Zhu, Lingdong Kong, Bo Chen, Lei Zhang, Yongyuan Liang,...
信任域目标构造 在线策略自蒸馏 奖励引导生成 强化学习对齐 扩散模型后训练

用一个 ReLU 门控把在策略蒸馏改造成合法的 RLVR 方法,零新增超参数

Wenze Lin, Jiale Zhao, Xitai Jiang, Songde Rao, Yining Li, Shenzhi Wang,...
RLVR 大模型后训练 强化学习 数学推理 知识蒸馏

固定元操作Ω并递归作用于其自身输出,构建深度自增长、角色涌现的自我提升智能体栈

Zae Myung Kim, Young-Jun Lee, Seungyeon Jwa, Dongyeop Kang
LLM智能体 元认知 程序合成 进化搜索 递归自我提升

用无超参方法把智能体轨迹压成小型FSM,统一支撑下一步预测、失败预测与运行时监控

Seonglae Cho, Franklin Cardenoso Fernandez, Umar Mohammed, Zekun Wu, Kleyton...
LLM智能体 工作流记忆 智能体安全监控 自动机学习 过程挖掘

免训练的熵谷选择器:解码前用全掩码平均熵为掩码扩散翻译自适应挑选目标画布长度

Yan Zhan, Mengkai Hou, Wanting Zhang, Zhijun Gao
免训练方法 掩码扩散语言模型 机器翻译 测试时长度选择 解码策略

把LLM前馈层改造成任务专家,任务级路由让1B模型超越8B基线且可即插即拔增删任务。

Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier Stricker
多任务学习 多模态大模型 模块化架构 混合专家 视频理解