← 前一天
2026-07-21
后一天 → 今日

把时序证据当区间集,从数据验证到 Wasserstein 奖励全程对齐,小模型全面超越超大模型。

Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li,...
Wasserstein距离 合成数据验证 多模态大模型 强化学习奖励设计 视频时序定位

轻量级头从冻结骨干隐状态直接读取逐行剪枝信号,省去外部评分模型。

Yuhang Wang, Yuling Shi, Shaoqiu Zhang, Jialiang Liang, Shilin He, Siyu Ye,...
上下文压缩 提示压缩 智能体上下文管理 编码智能体 隐状态探针

用群组熵引导的非对称优势塑形,缓解GRPO多任务训练的探索-利用失衡

Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen
GRPO 多任务强化学习 大语言模型对齐 强化学习 策略熵控制

实体导向的多模态长期记忆系统,感知流并围绕实体组织记忆,六项基准全部最优

Xiaokang Ma, Yifan Sun, Zhihong Jin, Jie Gu, Yudong Luo, Shenyi Shao, Chu...
多模态记忆 实体识别 流式感知 视频理解 长期记忆

证明长流程人机协作中,最优人类监督的间隔应非递减(前密后疏)

An Luo, Jie Ding
Agentic AI 人机协作 可扩展监督 智能体工作流 调度优化