找到 272 条结果

首个利用块离散扩散实现并行解码的OCR视觉语言模型,推理速度提升5倍

Sean Man, Roy Ganz, Roi Ronen, Shahar Tsiper, Shai Mazor, Niv Nayman 2026-02-24
OCR 并行解码 扩散模型 文档理解 视觉语言模型

阿里达摩院开源具身智能基础模型,统一感知/推理/规划,四个核心能力全面超越SOTA

Ronghao Dang, Jiayan Guo, Bohan Hou, Sicong Leng, Kehan Li, Xin Li, Jiangpin... 2026-02-19
具身智能 基础模型 多模态大模型 机器人 空间推理

通过微小图像扰动,在多轮对话中隐蔽地注入针对特定话题的恶意输出

Christian Schlarmann, Matthias Hein 2026-02-19
多模态安全 对抗攻击 对抗鲁棒性 视觉语言模型

字节跳动医疗AI团队提出的医疗视觉语言基础模型,在30+基准测试中达到SOTA性能。

Baorong Shi, Bo Cui, Boyuan Jiang, Deli Yu, Fang Qian, Haihua Yang, Huichao... 2026-02-16
临床推理 医学影像 医疗AI 多模态大语言模型 视觉语言模型