MBA:面向真实世界商业创意的多模态基准与智能体 MBA: Multimodal Benchmark and Agents for Real-World Business Ideation
首个多模态商业创意基准与智能体:30K样本、SFT+GRPO两阶段训练,7B模型比肩闭源MLLM
前置知识
LLM/MLLM-as-a-Judge(模型当裁判)
用一个强大的大模型(或多模态大模型)按固定评分细则(rubric)给另一个模型的输出打分,从而代替昂贵且主观的人工评估。裁判会根据维度定义在指定分数区间内独立打分,例如本文用 InternVL2.5-78B 按六个商业维度评估生成的商业点子。
本文的整套评估框架和强化学习奖励都建立在裁判模型之上;理解「训练裁判(Qwen2.5-VL-72B)与评估裁判(InternVL2.5-78B)刻意分离以避免奖励过拟合」这一设计,是读懂实验与训练目标的前提。
GRPO(组相对策略优化)
DeepSeek 提出的强化学习算法:对同一提示采样一组 $G$ 个候选回答,由裁判/规则打分后,用组内均值 $\mu$ 和标准差 $\sigma$ 把奖励归一化为优势 $A_i=\frac{r_i-\mu}{\sigma+\epsilon}$,从而省去价值网络。适合「没有唯一正确答案」的开放式任务。
MBA-b 与 MBA-k 的第二阶段训练就是 GRPO:把裁判对一组候选创意的相对排名作为奖励,推动 7B 模型摆脱均质化输出,生成更有创意且可行的商业点子。论文的核心增益来自这一步。
LoRA 与监督微调(SFT)
LoRA 把权重更新约束为低秩分解 $\Delta W = BA$($B\in\mathbb{R}^{d\times r}, A\in\mathbb{R}^{r\times k}$,秩 $r\ll d$),只训练极少量新增参数。SFT 则用下一词元预测损失 $\mathcal{L}_{\text{SFT}}=-\sum_t \log p(y_t\mid x, y_{<t})$ 拟合参考答案。
本文训练分两阶段:先用 LoRA-SFT 让 Qwen2.5-VL-7B 学会四字段结构化商业点子的输出格式与市场锚定(28.5K 实例),再用 GRPO 提质。理解这一流程才能复现和解读消融实验(SFT 只提升可行性类指标,创意类跃升靠 GRPO)。
RAG(检索增强生成)
先从输入中提取查询,再调用搜索引擎或向量库检索外部证据,最后让生成模型基于「输入+证据」作答,从而把开放域知识与真实市场信息注入生成过程,减少凭空臆造。
MBA-Bench 的构建管线本身就是一条 RAG 链路:GPT-4o 从图像提取检索查询 → DuckDuckGo 抓取市场证据 → 基于证据合成参考创意。可行性奖励同样依赖检索库 MBA-Library。不理解 RAG 就无法理解数据是怎么造出来的。
FActScore(原子事实评分)
把一段长文本分解成一条条原子事实(atomic facts),逐条到 Wikipedia 等知识库检索支持性证据,统计被支持的比率作为事实性分数,广泛用于评估长文本生成的真实性。
MBA-Library 用 FActScore 把生成的商业点子拆成原子事实并对照 Wikipedia 验证,得到 [0,1] 的「事实性」分数,与 FAISS 市场相关性一起构成可行性奖励。这是本文避免裁判幻觉、锚定真实世界的关键机制。
PBIG 六维商业评估体系
PBIG 共享任务(从专利生成产品商业创意)提出的六个评分维度:Specificity(具体清晰度,1–4)、Technical Validity(技术有效性,1–4)、Innovativeness(新颖性,1–5)、Competitive Advantage(竞争优势,1–4)、Need Validity(需求有效性,0–3)、Market Size(市场规模,0–3)。
MBA-Bench 完整沿用这六个维度作为评测指标(用 MLLM 裁判代替 LLM 裁判),MBA-k 还把其中六个 disclosed 指标直接作为训练奖励。所有主结果表都按这六维报告,不认识它们就读不懂 Table 3。
研究动机
现有自动化商业创意系统困在「文本进、文本出」的专利范式里:PBIG 从专利文档生成产品创意,Agent Ideate 用多个工具增强的智能体分解任务,MK2 用成对裁判迭代优化单个 prompt,评估全靠 LLM-as-a-Judge 在六个商业维度打分。这个范式有两个硬伤:其一,专利本身难以收集,且只覆盖「以文本为载体」的技术机会;其二,真实世界的商机往往首先以视觉形式显现——门店前的排队拥挤、工业品表面的细微缺陷、移动端 UI 的密集布局、材料的纹理质感——这些线索在被转写成文字时大量丢失。论文用实验证实了这一点:给每张图配强 captioner(PaliGemma2)生成描述后,仅用 caption 的基线在全部六个商业指标上全面落后于直接看图的多模态基线(Figure 2);用 LPIPS 定量衡量(Figure 7),即使是 GPT Image 2、Nano Banana、DallE-3、SD-v3.0 这类强生成模型,根据 caption 重建的图像与原图的 LPIPS 也高达 0.372–0.985,说明招牌位置、旋转对称的三维涡旋花纹这类细节根本无法被文字承载。另一方面,创业筛选的真实瓶颈巨大:风投机构平均每完成一笔投资要评估约 100 个项目、每个项目需要数月尽职调查(Gompers et al. 2020),自动化的创意生成与初筛因此有真实需求,但此前没有任何面向多模态场景的基准或专用模型。
本文的目标是本文要做三件事:第一,构建 MBA-Bench——首个面向「训练+评估」多模态商业创意的基准,包含 30K 个「图像–描述–问题–创意」四元组,覆盖六个按「视觉信息可言语化程度」递减排列的域,并配套六个(训练时最多八个)商业导向评估维度,用 MLLM-as-a-Judge 自动打分;第二,针对两种真实部署设定各提出一个任务专用智能体——评估标准未知的 blind 设定对应 MBA-b,标准已公开的 known 设定对应 MBA-k;第三,用 LoRA-SFT 加 GRPO 的两阶段流程,把一个 7B 开源多模态模型(Qwen2.5-VL-7B-Instruct)训练成能同时产出「新颖」且「可落地」商业点子的智能体,在开源模型中做到最优,并与 GPT-5、Gemini 3.x、Claude-Sonnet-4.6 等闭源模型正面比较。
与已有工作不同的是,本文的独特切入角度有三个。第一,它不满足于「加个图像输入」,而是把「图像里到底有多少文字说不清的信息」变成可系统研究的对象:六个域从 ADE20K 日常场景(文字基本能描述)到 RICO 界面截图、COCO 拥挤人群、VisA 缺陷图、DTD 纹理、DeepPCB 电路(文字越来越难描述),形成一条「可言语化梯度」,从而能定位 caption 方法在哪些域失效、多模态在哪些域收益最大。第二,它首次区分 blind 与 known 两种评估设定:现实中创业者未必知道评审标准,MBA-b 因此只优化两个任务一般目标(创意性=相对参考创意的新颖度、可行性=市场相关性+事实性),而 MBA-k 才利用全部八个奖励——这比「假设标准已知」的既有工作更贴近真实部署。第三,它不信任裁判模型在事实类维度上的打分:MLLM 裁判自己会幻觉出不存在的产品或市场数据,于是可行性奖励改由 MBA-Library(网页来源的 OpenAlex、Wikidata、移动应用、Wikipedia 知识库)通过 FAISS 检索相似度与 FActScore 原子事实校验来计算,把「接地」从模型内部知识搬到外部证据。
核心方法
先说直觉:一个好的商业点子必须同时「新」和「能落地」,而通用多模态模型的通病是输出趋同(mode collapse),只会给出市面已有的平庸方案。指望一次零样本提示解决不了这个问题,所以本文走「先模仿、再拉开差距」的两阶段路线。技术上,整条流水线分三块(Figure 3)。(1)基准构建:从六个公开数据集按标注得分选出 2000 张图像,用 PaliGemma2 生成 caption,GPT-4o 从图像的显著视觉观察中提取检索查询(如「服务台前排起长队」),经 DuckDuckGo API 检索市场证据,再针对成本、技术、用户体验三类商业问题,把「图像+caption+域+查询+证据」组成统一问题提示,让 GPT-4o 为每个问题生成 5 个含标题/描述/实施/差异化四字段的参考创意,共得 $2000\times3\times5=30000$ 个四元组,按图像 95:5 划分训练/测试。(2)SFT:对 Qwen2.5-VL-7B-Instruct 做 LoRA 微调,用下一词元预测损失 $\mathcal{L}_{\text{SFT}}=-\sum_{t}\log p_{\theta,\phi}(y_t\mid x, y_{<t})$ 拟合参考创意,共 28.5K 训练实例。(3)GRPO:对每个统一提示采样 $G=4$ 个候选创意,裁判(训练用 Qwen2.5-VL-72B)在组内按各目标排名并折算成 [0,1] 分,加权组合为奖励 $r_i$,再组内归一化为优势 $A_i=\frac{r_i-\mu(\{r_j\}_{j=1}^{G})}{\sigma(\{r_j\}_{j=1}^{G})+\epsilon}$,按 $\mathcal{L}_{\text{GRPO}}=-\mathbb{E}_i[A_i\log\pi_\theta(o_i\mid x)]+\beta\,\mathbb{E}_i[D_{\text{KL}}(\pi_\theta\Vert\pi_{\text{ref}})]$ 更新策略,向冻结的 SFT 参考策略 $\pi_{\text{ref}}$ 施加 KL 约束。
核心创新有四点,且每一点都与既有方法有本质区别。第一,任务重定义:把商业创意从「专利文本」搬到「多模态真实场景」,并首次给出可训练、可评测的形式化(30K 四元组 + 八维评分),此前的 PBIG/Agent Ideate/MK2 全部以专利为唯一信息源。第二,blind/known 双设定:现有工作默认评估 rubric 已知且可用,本文指出真实部署中标准常常未知,于是 MBA-b 只用创意性(相对 5 个参考创意的排名新颖度)和可行性(市场相关性+事实性)两个任务一般奖励训练,MBA-k 才加上六个公开指标,共八个奖励。第三,奖励的接地方式:可行性不靠裁判打分——裁判会幻觉出不存在的市场事实——而是用 FAISS 在 MBA-Library(OpenAlex 学术文献、Wikidata 结构化实体、移动应用数据、Wikipedia)中检索 top-k 最近记录,以平均余弦相似度衡量市场相关性,再用 FActScore 把创意拆成原子事实逐条对照 Wikipedia 验证;两分数归一化到 [0,1] 后组合。第四,奖励形式:不做绝对打分,而做组内相对排名,规避裁判尺度偏置(不同创意常被给同一分数),这也让「创意性」天然定义为相对参考组的分布位置而非绝对标签。
方法步骤详情
完整步骤如下。(一)数据构建(Algorithm 1):第一步按域内标注得分选图——General 用 ADE20K 按物体多样性选 500 张,Spatial Layout 用 RICO 按组件数与文字密度选 350 张,Crowding 用 COCO 限「≥10 个标注行人」按人数与物体多样性选 350 张,Visual Condition 用 VisA 按固定比例偏向异常样本选 350 张,Shape & Texture 用 DTD 均匀覆盖纹理属性选 350 张,Technical Features 用 DeepPCB 优先带缺陷标注选 100 张;第二步 PaliGemma2 生成 caption;第三步 GPT-4o 提取视觉化检索查询;第四步 DuckDuckGo API 检索市场证据(现有方案、等待时间统计等);第五步对每图的三个商业问题(成本效率/技术/用户体验)各构造统一提示 $x=(v,c,b,q,e)$,GPT-4o 生成 $K=5$ 个四字段参考创意;第六步按图像划分 95:5。(二)SFT(Algorithm 2):LoRA 秩 32、缩放 64、dropout 0.05,训练 2 个 epoch,学习率 $2\times10^{-5}$,warmup 比例 0.1,全局 batch 32。(三)GRPO:学习率 $1\times10^{-6}$,每提示采样 $G=4$ 个候选,KL 系数 $\beta=0.02$,batch 4,训练 1 个 epoch;奖励权重——MBA-b 为创意 0.70、可行 0.30;MBA-k 为 Spec/T.V./Innov/C.A./N.V./M.S./创意/可行 = 0.12/0.12/0.20/0.16/0.12/0.08/0.10/0.10。(四)评估(Algorithm 3):InternVL2.5-78B 裁判按六维打分,100 张测试图像、每图 15 条响应(3 问题×5)先平均到图像级,再报告均值与标准差。
技术新颖性
技术新颖性可从四个层面评估。任务层面:此前商业创意生成全部锚定专利文本(PBIG 系列、Agent Ideate、MK2),本文首次把它形式化为多模态任务,并设计了「可言语化梯度」式六个域,让跨模态信息损失从模糊假设变成可测量的实验变量(caption 基线仅在 General 域接近多模态基线)。奖励设计层面:创意性奖励被定义为「相对 5 个 GPT-4o 参考创意的排名新颖度」而非绝对创新标签,可行性奖励被拆成检索相似度+FActScore 两路非裁判信号,并且训练裁判(Qwen2.5-VL-72B)与评估裁判(InternVL2.5-78B)刻意分离,防止策略对单一裁判过拟合——这套组合在开放式生成任务的 RL 文献里是少见的完整工程。算法层面:把 GRPO 从有确定答案的感知任务(Visual-RFT)和科学创意(Debate-as-Reward)推广到「无唯一正解、双目标(创新+可行)加权」的商业场景,并用组内排名规避裁判尺度偏置。评估层面:用 MLLM-as-a-Judge 取代 LLM-as-a-Judge,使评分必须同时推理视觉证据、技术可行性与市场语境。附带的 MBA-Library 本身也可视为贡献:一个覆盖学术、实体、应用、百科的可行性接地资源。
实验结果
主结果(Table 3,100 张测试图像,六维评分):MBA-k 达到 Spec 3.99 / T.V. 3.00 / Innov 4.00 / C.A. 3.32 / N.V. 2.94 / M.S. 2.75,MBA-b 为 3.64/3.12/3.98/3.19/2.38/2.20;对比零样本基线 Qwen2.5-VL-7B 的 3.60/3.06/3.15/2.62/2.32/1.94 与 GPT-5 的 3.99/3.08/3.97/3.27/2.44/2.10。汇总来看,MBA-b 与 MBA-k 分别超过 caption 基线 63.9% 和 77.1%,超过多模态基线 25.6% 和 35.8%。分维度看:MBA-k 在 Market Size 上是全场第一(2.75,比 GPT-5 的 2.10、Gemini 3.1 Pro 的 2.35 高出 0.40–0.68),Need Validity 2.94 仅次于 Gemini 系(2.97);两个模型的 Innovativeness(3.98/4.00)都显著高于基线(3.15),说明 GRPO 的创意奖励有效,而仅 SFT 的 MBA-7B-SFT 只有 3.22,证明创意跃升确实来自 RL 阶段;SFT 单独已能提升可行性类指标(如 C.A. 2.62→2.57 略降但 N.V./M.S. 结构性改善,具体为 MBA-SFT 在 Spec/T.V. 上 3.68/3.09 超基线)。Figure 5 的图像级分布显示 MBA-k 在 Competitive Advantage 和 Market Size 上中位数与均值全面领先十个模型,Specificity 各模型普遍贴近上限存在天花板效应,MBA-k 在 Technical Validity 上有轻微折损(3.00 vs GPT-5 mini 的 3.07、Claude-Sonnet-4.6 的 3.16)。Figure 6 验证训练奖励与测试指标对齐:模型排名在训练两目标与测试六指标聚合上高度一致,Spearman 秩相关分别为 $\rho=0.83$(创意)与 $\rho=0.71$(可行),两个智能体在 Creativity*/Feasibility* 上领先多模态基线 51.2% 和 114.3%。Table A2 的 Wilcoxon 符号秩检验(Holm 校正)显示 18 组「模型×指标」比较中 12 组显著,MBA-k 在 Innovativeness、Competitive Advantage、Market Size 上显著优于 GPT-5 mini、Gemini 3.1 Pro 与 InternVL2.5-8B 全部三个对手。可靠性方面(Table A4),MBA-k 的严重语义失败率仅 0.40%、JSON 格式无效率 3.40%,远好于 Qwen2.5-VL-32B(5.13%、99.80%)、LLaVA-OneVision-7B(12.60%、61.33%)、InternVL2.5-8B(6.73%、16.93%),接近 GPT-5 mini(0%、0.07%)。模态消融(Figure 2)证明 caption 基线只在 General 域勉强可用,多模态输入在图像特定域大幅提升;captioner 消融(Table A3)换用 Gemini 或 GPT-5 做 caption 结果几乎不变,说明瓶颈在「文字化」本身。域分析显示 T.V. 在 Technical Features 与 Visual Condition 最高,N.V./M.S. 在人物密集的 General 与 Crowding 最高。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MBA-Bench 全指标综合 | 六维平均相对提升 | MBA-b / MBA-k | caption 基线 / 多模态基线(Qwen2.5-VL-7B 零样本) | +63.9% / +77.1%(对 caption 基线);+25.6% / +35.8%(对多模态基线) |
| 商业创意生成(Innovativeness,1–5) | Innovativeness | MBA-k 4.00 / MBA-b 3.98 | Qwen2.5-VL-7B 3.15;GPT-5 3.97 | +0.85(绝对值,vs 开源基线);与 GPT-5 持平或反超 |
| 商业创意生成(Competitive Advantage,1–4) | Competitive Advantage | MBA-k 3.32 | Qwen2.5-VL-7B 2.62;GPT-5 3.27 | +0.70(vs 开源基线);+0.05(vs GPT-5) |
| 商业创意生成(Market Size,0–3) | Market Size | MBA-k 2.75 | Qwen2.5-VL-7B 1.94;GPT-5 2.10;Gemini 3.1 Pro 2.35 | +0.81(vs 开源基线);+0.40(vs 最强闭源) |
| 商业创意生成(Need Validity,0–3) | Need Validity | MBA-k 2.94 | Qwen2.5-VL-7B 2.32;GPT-5 2.44;Gemini 3.5 Flash 2.97 | +0.62(vs 开源基线);与 Gemini 系(2.97)基本持平 |
| 输出可靠性(100 图 × 15 响应) | 严重语义失败率 / 无效格式率(越低越好) | MBA-k 0.40% / 3.40% | Qwen2.5-VL-32B 5.13% / 99.80%;GPT-5 mini 0.00% / 0.07% | 语义失败率比最强开源基线低 4.7–12.2 个百分点,接近闭源水平 |
| 训练奖励与测试指标一致性 | Spearman 秩相关 ρ | 创意 0.83 / 可行 0.71 | —(对齐性验证实验,无基线) | 证明两个训练奖励能泛化到六维测试 rubric |
局限与改进
作者承认三点局限:其一,MBA 目前只利用图像与文本,而真实环境还包含语音语调、嗅觉、触觉等信号(如食品、医疗、制造、安全场景中气味可能是关键商机线索);其二,模型只对单帧做空间推理,不建模时序信息——路边静止车辆的图像会导向停车服务创意,而一段「孩子突然从车间穿出」的视频则会引出安全防护方案,时序多模态推理是缺失的;其三,创意生成与评估完全不考虑创业者个体差异——同样的点子对有资本、有供应链资源的人可行,对个人开发者未必,缺乏个性化条件化。我自己的观察还有几条:评估完全依赖 MLLM 裁判(InternVL2.5-78B),虽与训练裁判分离,但全文没有人类专家评估(仅援引 MK2 在人评中 5/6、4/6 维度第一的结果作间接类比),「裁判评得准不准」本身未被验证;测试集只有 100 张图像,且域间样本不均衡(ADE20K 500 张 vs DeepPCB 100 张);参考创意全部由 GPT-4o 生成,「创意性」实质是相对 GPT-4o 风格的新颖度,可能系统性锚定在单一模型的分布上;所有结果为单次运行(种子 2026),没有多随机种子方差;市场证据来自 DuckDuckGo 英文检索,跨语言、跨地区市场的适用性未知;MBA-k 的八维奖励权重(0.12/0.12/0.20/0.16/0.12/0.08/0.10/0.10)与 MBA-b 的 0.70/0.30 权重未见敏感性消融。
独立分析的弱点
独立分析以下弱点。第一,裁判有效性循环:论文用「MBA-k 优化了裁判打分」证明方法有效,但裁判打分是否等同于真实商业价值完全未验证——改进方向是招募创业者在盲评下对比 MBA-k、GPT-5 与人类专家的点子,报告人评与裁判分的秩相关(类似 MK2 的做法但规模更大)。第二,创意性奖励的参考锚定偏置:创意被定义为「相对 GPT-4o 五个参考的新颖度」,若 GPT-4o 的创意分布本身偏窄,模型会被推向「偏离 GPT-4o」而非「真正创新」,极端情况下鼓励标新立异但无价值的输出——可引入人类创意库、专利库、众筹产品库等多源参考做分布外新颖度。第三,可行性接地仍是弱信号:FAISS 余弦相似度只能说明「与已有方案语义相近」,相近不等于市场相关(一个与热门 App 相似的坏点子相似度同样高)——可改成检索后的判别式打分器或让裁判对检索证据做推理式引用。第四,测试集规模与统计功效:100 张图、单次运行,指标差异 0.1 级别的结论脆弱——扩到全量 1500 张测试样本并报告多种子。第五,域不平衡与域外泛化:DeepPCB 仅 100 张且六个域来自高度特定数据集,对真实用户随手拍的场景(低画质、遮挡、文化差异)泛化未知——加入 in-the-wild 图像与零样本域评测。第六,数据构建对 GPT-4o 的依赖带来成本与许可风险:GPT-4o 生成内容的商用条款与模型更新都会影响可复现性——可用开源强模型复刻管线并对比质量。
未来方向
作者明确提出的方向有三:(1)扩展到更多感官模态——语音语调与背景声可指示情绪与地域特征,嗅觉线索在食品、医疗、制造、安检中可能暴露潜在需求,从而提升创意的多样性与情境特异性;(2)时序多模态推理——视频提供运动、行为与因果上下文(如「孩子突然从停车间隙穿出」引出安全方案),将显著改变可挖掘的商业机会类型;(3)个性化商业创意——把生成与评估条件化在用户的资本、专长、区位、社交网络与风险偏好上,让点子不仅「普遍可行」而且「对该个体可执行」。基于本文成果还可以延伸:把 MBA-Library 从静态奖励资源升级为推理时可主动调用的 agentic 检索工具(模型自主决定搜什么、何时搜);引入多裁判辩论或人机混合评审提升奖励可靠性;做创意的纵向回测——追踪生成的点子在此后 1–2 年是否真的被创业者实施或获得融资,以此校准 PBIG 六维与真实商业成功的相关性;研究从六域到开放场景的零样本迁移;以及探索奖励权重自动搜索替代手工设定的 0.12/0.20/0.16 等系数。
复现评估
复现条件总体良好。开源情况:代码在 github.com/hchoi256/MBA,MBA-Bench 数据在 HuggingFace(hchoi256/mba),MBA-Library 的组成部分(OpenAlex、Wikidata 为 CC0,FAISS/FActScore 实现为 MIT)均为公开资源。数据构建需要 GPT-4o API 与 DuckDuckGo API(有费用;GPT-4o 版本更新可能改变生成内容,论文未冻结具体快照版本,这是复现性的一个隐患),caption 部分用 PaliGemma2 公开权重本地推理(作者特意选它就是因为公开权重、确定性本地推理、不依赖 API 更新)。算力:训练在 8×NVIDIA RTX A6000(每卡约 45 GiB 显存)+ 双 AMD EPYC 7513 上进行,7B 模型 + LoRA(秩 32)+ GRPO(G=4)的规模对有单机 8 卡 A6000/类似算力的团队完全可行;评估另需约 30 GiB/卡,并要加载 InternVL2.5-78B(评估裁判)与 Qwen2.5-VL-72B(训练奖励裁判)做推理,这是最大的显存/工程门槛。超参完整公开:LoRA rank 32 / α 64 / dropout 0.05,SFT 2 epochs、lr $2\times10^{-5}$、warmup 0.1、batch 32,GRPO 1 epoch、lr $1\times10^{-6}$、KL 0.02、batch 4,奖励权重逐项给出,随机种子 2026,并附三个算法伪代码与全部提示模板(Figures A7–A10)。注意事项:所有结果为单次运行,裁判打分存在随机性,复现时数值可能有波动;测试集仅 100 图,小幅指标差不宜过度解读。总体难度评级:中等偏上——数据和代码齐全使复现门槛远低于从零构建,但 78B 级裁判模型的推理成本与 GPT-4o 依赖需要预算。
论文图表
两组定性对比:每行给出原图 caption、原图与四个生成模型(GPT Image 2、Nano Banana、DallE-3、SD-v3.0)按 caption 重建的图像及 LPIPS 距离。上例(走廊指示牌场景)caption 漏掉招牌的具体位置细节,LPIPS 为 0.430/0.372/0.422/0.530;下例(黑白欧普艺术图案)caption 即使准确描述了每处线条走向,也无法表达中央旋转的三维涡旋语义,LPIPS 高达 0.392/0.714/0.394/0.985(SD-v3.0 最差)。
这是「为什么必须多模态」的最有力证据:连最强文生图模型都无法从 caption 恢复原图的感知信息,说明跨模态转换存在不可逆损失。它把论文动机从直觉变成了可量化事实(LPIPS 数字),直接支撑 MBA-Bench 的设计。
General 域完整样例:机场航站楼内景(ADE20K 风格)+ caption + 查询「Airport terminal energy efficiency solutions」+ 成本效率商业问题 + Prineville 机场的 FBO 服务市场证据,以及生成的创意「Micro-Airport Energy Optimization-as-a-Service」(面向小型机场的即装即用节能改造服务,宣称 20–40% 公用事业费节省),右上角六维打分为 4/3/4/3/3/2。
展示基准中「易言语化」域的完整数据形态与创意质量,帮助读者直观校准样本难度与四字段创意的结构。
Spatial Layout 域样例:OneTravel 信用卡推广页的手机截图 + AI 自动化商业问题 + 移动 SaaS UI 证据,生成创意「EcoFlow UI Auditor」——通过计算机视觉分析界面层级、触控目标与对比度,并联动功耗剖析生成省电无障碍 UI 变体的 B2B 工具,六维打分 4/3/4/3/3/2。
演示 UI 截图这类「组件密集、文字密度高」的视觉输入如何催生移动应用类商业创意,体现该域的设计意图。
Crowding 域样例:迪士尼乐园圣诞季 Donald Duck 合影区人群场景 + 客户体验商业问题 + 拥挤服务管理证据,生成创意「CharacterFlow」——用边缘视觉相机做实时密度图、微预约窗口、动态导航和员工调度台来编排主题乐园排队与角色互动,六维打分 4/3/4/3/3/3。
展示「人数≥10」的拥挤场景如何导向客流运营类商机,是 Need Validity/Market Size 在该域得分最高的具体例证。
Visual Condition 域样例:一块缺角的白色橡皮特写(VisA 异常风格)+ 质检相关查询与客户体验商业问题 + 家居检测行业营销证据,生成创意「ClearQC for Confectionery」——为糖果产线提供 AI 表面缺陷检测、自动剔除与面向消费者的二维码质检报告服务,六维打分 4/3/4/3/3/2。
体现「细微表面缺陷难以用 caption 完整表达」的域特征,以及缺陷视觉信号如何转化为质检类商业创意。
Shape & Texture 域样例:红蓝黄绿多色羊毛条特写(DTD 纹理风格)+ 纺织业可持续采购查询 + LinkedIn 纺织供应链证据,生成创意「ColorCycle Felt」——回收预染色纺织边角料、用 AI 配色引擎免染色混纺成毛毡面料的服务,六维打分 4/3/4/3/3/3。
展示材质纹理这类「几乎无法言语化」的视觉语义如何支撑产品与材料类创意,是论文核心假设(纹理信息只在图像里)的正面案例。
Technical Features 域样例:黑白 PCB 电路板局部特写(DeepPCB)+ AI 驱动 PCB 检测查询 + Intelgic 机器视觉检测方案证据,生成创意「TraceGuard AI — Design-Aware PCB Inline QA」——融合高分辨率视觉与 CAD/Gerber 设计知识做预测性缺陷检测与良率优化的 B2B 平台,六维打分 4/4/4/3/3/3。
展示最细粒度的结构化视觉域(微小元件、走线、缺陷)如何导向硬科技商机,也是该域 Technical Validity 得分偏高的例证。