找到 448 条结果

对数概率奖励在可验证和不可验证领域均为CoT训练提供统一信号

Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier 2026-02-05
大语言模型 奖励设计 强化学习 推理优化 链式思维

提出950道高难度多轮幻觉基准,揭示前沿LLM仍存在约30%+的幻觉率

Dongyang Fan, Sebastien Delsad, Nicolas Flammarion, Maksym Andriushchenko 2026-02-05
事实性评估 基准测试 多轮对话 大语言模型 幻觉评测

基于MLLM的对象嵌入模型,用对象+IoU双token实现精细视觉理解与检索

Shenghao Fu, Yukun Su, Fengyun Rao, Jing Lyu, Xiaohua Xie, Wei-Shi Zheng 2026-02-04
多模态嵌入 大语言模型 对比学习 对象检测 视觉检索

通过递归压缩轨迹为结构化状态表示,实现跨轮次经验复用,突破ReAct线性框架的探索瓶颈

Jialiang Zhu, Gongrui Zhang, Xiaolong Ma, Lin Xu, Miaosen Zhang, Ruiqi Yang,... 2026-02-03
ReAct框架 大语言模型 测试时扩展 深度搜索智能体 轨迹压缩

将推理链渲染为图像来引导VAE框架下的潜在推理,实现高效压缩且超越显式CoT

Fanmeng Wang, Haotian Liu, Guojiang Zhao, Hongteng Xu, Zhifeng Gao 2026-02-02
变分自编码器 大语言模型 思维链 潜在推理 视觉-文本压缩