找到 448 条结果

通过将观测分解为对象-属性结构,实现零样本跨域奖励预测

Yijun Shen, Delong Chen, Xianming Hu, Jiaming Mi, Hongbo Zhao, Kai Zhang,... 2026-03-11
世界模型 大语言模型 奖励预测 强化学习 智能体规划

通过逐层渐进激活残差连接,提升Transformer预训练稳定性和性能

Tianhao Chen, Xin Xu, Lu Yin, Hao Chen, Yang Wang, Shizhe Diao, Can Yang 2026-03-09
Transformer架构 大语言模型 残差连接 深度扩展 预训练优化

用自身简洁行为蒸馏模型,无需标注即压缩推理token并提升准确率

Hejian Sang, Yuanda Xu, Zhengze Zhou, Ran He, Zhipeng Wang, Jiachen Sun 2026-03-06
大语言模型 强化学习替代方案 推理优化 推理压缩 知识蒸馏

首个系统评估视频LLM实时交互能力的基准,覆盖记忆、感知与主动响应

Yansong Shi, Qingsong Zhao, Tianxiang Jiang, Xiangyu Zeng, Yi Wang, Limin Wang 2026-03-05
在线交互 基准测试 大语言模型 实时推理 视频理解