AI 旅行会议:基于 LLM 智能体的群体旅行规划框架 AI Tour Meeting: Group Travel Planning by LLM Agents
多个人格化 LLM 智能体通过对话与投票协同商定群体旅行行程
前置知识
基于人格的 LLM 智能体模拟
给一个 LLM 注入一套稳定的人格属性(如姓名、背景、性格、偏好、目标、语气),通过系统提示让它角色扮演,使其在多轮交互中表现得像一个特定的人。代表作是斯坦福的 Generative Agents(Park et al., 2023),它让 25 个智能体在虚拟小镇中自主生活、传播信息、组织派对,展示了 LLM 模拟可信人类社会行为的潜力。
本文的每位「会议参与者」本质上就是一个带人格的 LLM 智能体,理解这种范式才能看懂为什么作者要用 persona 系统提示、阶段标记和动作日志来驱动对话,以及为什么本文要把通用的人格模拟特化到旅行规划领域。
通用多智能体框架
提供编排多个 LLM 智能体交互的基础设施,例如 AutoGen 提供可对话智能体和群聊编排,CAMEL 通过角色扮演的双智能体完成「思维探索」任务。这类框架通常解决的是「谁对谁说话、怎么轮流、怎么终止」等通用机制,但不内置任何特定任务的结构。
本文反复强调自己与 AutoGen、CAMEL 的区别:这些通用框架需要用户从零实现行程表示、提案-投票流程、约束校验等旅行规划专用组件,而本文把这些做成了开箱即用的领域抽象。理解这个区别,才能抓住本文「领域专用」这一核心卖点。
群体决策与投票规则
当多个人对同一方案有不同偏好时,需要聚合规则把个体意见合并为集体决策。常见规则包括多数决(Majority,过半即通过)、一致同意(Unanimous,全员同意才通过)、单一决策者(Single decider)、最大总效用(Most pleasure,分数之和最大)和最少痛苦(Least misery,最小分数最大)。这些规则源自社会选择理论与推荐系统中的群体推荐问题。
投票规则是 AI Tour Meeting 的核心可配置项,论文的多个实验(如偏好冲突分析)都依赖多数投票来判定行程是否被采纳。理解这些聚合规则的差异,才能读懂不同设置下共识率、受害者率为什么会变化。
研究动机
群体旅行规划是一个典型多目标协调问题:要在成本、行程时长、个人偏好之间为多位参与者找到平衡。已有工作主要面向「辅助真人做决定」,例如 Nguyen and Ricci(2018)用聊天机器人监控讨论并动态调整推荐,Chen et al.(2021)用注意力机制整合成员关系与 POI 信息优化群体行程,Cheng et al.(2026)的 GroupTravelBench 则研究 LLM 能否在解决偏好冲突的同时完成规划。同时,更广的领域里出现了用带人格的 LLM 智能体模拟人类行为的热潮(Generative Agents、SOTOPIA、PersonaLLM),以及 CAMEL、AutoGen 等通用多智能体框架。问题是:这些工作要么只服务真人、要么是通用框架不含任何旅行规划专用结构,当研究者想用 LLM 智能体批量模拟「一群人商量去哪玩」时,仍需自己从零造轮子。
本文的目标是作者的目标是构建一个名为 AI Tour Meeting 的、面向群体旅行规划的专用多智能体框架,让多个带人格的 LLM 智能体通过自然语言对话和投票,共同商定一条满足各自约束与偏好的行程。这个框架既要能作为仿真工具,用于分析多个 LLM 智能体在旅行规划讨论中的行为,也要能用于自动评估已有的群体旅行推荐系统;在应用层面,还希望让人能把无法到场的朋友表示成一个 LLM 智能体,把缺席者的观点纳入讨论。为此框架需要提供:结构化的行程表示、显式的提案-投票工作流、约束校验与度量监控,以及配置人格、编排工作流、监控会议、部署 LLM 的完整界面。
与已有工作不同的是,本文的独特切入角度是领域专用抽象。它指出通用多智能体框架(AutoGen、CAMEL)虽能编排交互,但用户必须自己实现旅行规划所需的结构化行程、提案-投票流程、约束校验等组件;而已有的人格模拟工作(Generative Agents、SOTOPIA)又不针对旅行规划。AI Tour Meeting 的差异在于把这些领域组件做成默认能力——结构化行程表示 $R = (d_1, d_2, \ldots, d_N)$、显式的提案-投票两阶段工作流(带五种轮转规则和五种投票规则)、以及专门面向旅行规划的约束校验和指标监控(如时间窗口违反、动作失败率、令牌用量),让用户专注于用例本身。
核心方法
整体思路是先直观后技术。直觉上:把一场「一群人商量行程」的会议拆成两个反复交替的阶段——对话阶段(搜索信息、提问、反思、提出新行程)和投票阶段(对提案投接受/拒绝/打分)。技术路线上,框架用四个核心抽象组织:(1) 行程 $R = (d_1, d_2, \ldots, d_N)$,每个目的地 $d_i$ 含名称、描述、成本、到达时间、停留时长、交通方式与交通成本/时长;(2) 参与者,每个 LLM 智能体带一套人格属性(姓名、背景、性格、偏好、目标、角色、语气、解释风格),人格作为系统提示注入;(3) 动作模型 $(a^{types}_s, msg_s, a_s) = p_m(persona_m, H_{s-1})$,参与者在给定历史 $H_{s-1}$ 下输出动作类型、消息和具体动作;(4) 工作流,由全局目标、参与者、约束、轮转规则、投票规则组成。会议按 Algorithm 1 循环,直到所有参与者连续表示满意或达到轮数/时间上限。
核心创新是把「群体旅行规划讨论」建模成一个有领域语义的两阶段、可配置、可监控的多智能体协议,而非通用的自由对话。具体区别有三点:第一,引入结构化的行程对象和约束(预算、09:00–18:00 时间窗),使每次提案都可被自动校验(时间一致性、成本),违反时进入重试循环(最多 3 次),把旅行规划的关键约束内建进协议;第二,把对话和投票显式分离,并提供五种轮转规则(轮询 Round robin、邀请 Inviting、主持 Facilitating、随机 Random、并行 Parallel,外加 Balancing 公平轮和 Volunteer 自愿跳过选项)与五种投票规则(Majority、Unanimous、Single decider、Most pleasure、Least misery),让群体决策的聚合方式可灵活切换;第三,为仿真分析专门采集系统级指标(令牌用量、重试数、时间违反数)和讨论动力学指标(步数、轮数、动作类型分布、投票与分数分布、提案明细)。
方法步骤详情
完整运行流程(Algorithm 1):初始化最终行程 $R_{final} \leftarrow \varnothing$、历史 $H \leftarrow \varnothing$、满意计数 $C \leftarrow 0$。当 $C < M$(参与者数)时循环:按轮转规则 $\pi_{turn}(P)$ 选发言者 $p$,其单轮内可多次执行中间动作(search 检索、ask 提问、reflect 反思),结果追加到 $H$;一旦执行 propose 生成新行程 $R'$ 即进入投票阶段,对其余 $M-1$ 位按 $\pi_{turn}(P \setminus p)$ 依次投票,他们可先做中间动作再给 accept/reject,收齐投票 $V$ 后按 $\pi_{vote}(V)$ 判定,接受则 $R_{final} \leftarrow R'$。回到对话阶段,某人执行 satisfied 则 $C$ 加 1,否则重置为 0;全员连续满意或达轮数/时间上限即终止并返回 $R_{final}$。提案违反时间/成本约束时触发最多 3 次重试,长会议可用摘要压缩或截断管理上下文。
技术新颖性
技术新颖性在于领域专用、可配置协议、内置校验与监控的组合。相比 Generative Agents、SOTOPIA 这类人格仿真,本文专门为旅行规划设计了结构化行程对象、约束校验和提案-投票工作流;相比 AutoGen、CAMEL 这类通用框架,本文把这些组件做成默认能力,用户不必从零实现。此外,框架的每个参与者可独立配置基础模型、温度、种子、上下文管理方式,并支持商用 LLM 与本地 LLM(经 Ollama 或 vLLM 部署),这种角色级模型异构和重试加约束校验的工程化设计,使其能可靠承载真实规模的仿真。可解释性方面,解释风格(主观/对比/两者)可配置,把说服策略也显式建模进人格,这在同类工作中较为少见。
实验结果
核心发现分三块。系统验证(Table 1,50 场、3 人、混合偏好):Qwen3.5-2B 不可用(完成 82%、共识 58%、约束错误 14.2%、61.5 轮);4B 起稳定可用——4B 达 100%/100%、约束错误 3.1%、15.7 轮,9B 最稳(0.0% 错误、12.8 轮),gpt-oss-20b 同为 100%/100%,结论是需 ≥ Qwen3.5-4B 的 LLM。偏好冲突分析(Table 2):aligned/mixed/conflicting 轮数为 $10.3\pm7.60$/$12.1\pm9.80$/$25.9\pm22.7$,共识率 100%/100%/94%,满意度 8.93/8.39/7.13,受害者率 0.7%/1.3%/11.3%,复现了冲突越大、讨论越长、越难令人满意的人类审议规律。发言顺序(Figure 5)显示 mixed/conflicting 中第 2、3 位接受率显著高于第 1 位。规模扩展(Table 3,9B):M=3/5/10 完成率均 100%,输入令牌 134K/659K/3074K 近似超线性增长。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 系统鲁棒性(跨模型/规模) | 会议完成率与共识率 | Qwen3.5-4B 及以上均达 100%/100%;M=10 时 100%/96% | Qwen3.5-2B 仅 82%/58% | 达到 4B 后从不可用跃升至稳定可用 |
| 偏好冲突下的讨论动力学 | 轮数 / 受害者率 | conflicting 档 25.9±22.7 轮、11.3% 受害者率 | aligned 档 10.3±7.60 轮、0.7% 受害者率 | 定性复现人类审议中冲突加剧的规律 |
| 发言顺序对接受率的影响 | 提案接受率(Figure 5) | mixed/conflicting 中第 2、3 位发言者接受率显著更高 | aligned 各位置无显著差异 | 揭示后发言者借前序反馈更易达成共识的机制 |
局限与改进
作者承认的局限:代码采用 NTT 专有许可,仅限研究用途(这与「主要用作仿真工具」的定位尚算契合,但限制了社区复用与二次开发);会议时长高度依赖部署 LLM 的硬件(表中的分钟数仅供参考)。我自己的观察还有四点:其一,所有参与者偏好和事后满意度评判都是用 gpt-5.4-mini 合成生成的,存在评估器与被评估模型同源的循环风险,结论可能受合成数据偏差影响;其二,所有实验仅 50 场会议/设置,且未与任何真实的群体旅行推荐系统或真实人类小组做对照,因此复现人类审议规律目前只是定性相似,缺乏定量对标;其三,当参与者增至 10 人时输入令牌飙到 3074K、轮数 68.6、时长 471.5 分钟,扩展性瓶颈明显,文中未给出更激进的规模化结果或成本分析;其四,框架只校验行程级约束(时间窗、预算),没有引入真实地图/交通 API 来核验地点可达性与交通时长,行程的现实合理性仍依赖 LLM 估计。
独立分析的弱点
独立分析的弱点及改进方向:(1) 评估闭环依赖合成数据——偏好、冲突档位、满意度打分均由同一 LLM 生成,建议引入真实人类小组的旅行规划日志或既有群体推荐数据集做外部校准,并做 LLM-as-judge 的人工一致性核查。(2) 可扩展性不足——M=10 已达 3074K 输入令牌、471.5 分钟,可考虑层级化会议(先小组讨论再代表汇总)、异步并行投票、或基于摘要的更激进上下文压缩来支撑数十人规模。(3) 缺乏真实地理/交通校验——行程的地点可达性、交通时长完全由 LLM 估计,建议接入地图 API(如 OSRM、Google Maps)做硬约束校验,把现实可行性纳入通过条件。(4) 投票与说服策略偏简单——五种投票规则未做系统性比较,说服仅靠解释风格切换,未来可引入谈判理论中的让步模型、议题分解投票,提升冲突档下的公平性(降低 11.3% 受害者率)。(5) 缺少与真人行为的定量对照,难以判断智能体是否真的像人。
未来方向
作者明确提到的方向:把框架用作研究工具,分析 LLM 智能体行为、自动评估群体旅行推荐系统;并展望一类新应用——让 LLM 智能体作为缺席成员的代理参与真人讨论(Appendix C 已给出交互式模式的聊天框原型)。基于本成果可延伸的方向包括:将提案-投票协议迁移到其他需要群体协调的领域(会议日程、聚餐选址、团队任务分配),验证领域专用抽象的可迁移性;用本框架对各类 LLM 做「群体协调能力」基准评测,补充现有以单人规划为主的 TravelPlanner、GroupTravelBench;研究上下文压缩策略与共识质量、公平性的权衡;探索把对比式解释(作者另一工作 RouteExplainer)与说服策略深度结合以改善冲突档下的受害者率。
复现评估
复现评估:开源代码与文档齐全(文档站 https://ntt-dkiku.github.io/ai-tour-meeting、代码库 https://github.com/ntt-dkiku/ai-tour-meeting、演示视频),并提供 GUI 与 Python API(Figure 3 的 build_meeting 几行即可启动会议),工程完整度较高。但有两点门槛:一是采用 NTT 专有许可,明确仅限研究用途,商业或衍生分发受限;二是完整复现实验需要本地部署 Qwen3.5-2B/4B/9B、gpt-oss-20b 等模型,文中说明本地模型用 vLLM 在单块 RTX A6000(48GB)上服务,因此需要相应量级的 GPU(9B 及以上需较大显存),gpt-5.4-mini 则需 OpenAI API。合成会议的偏好/冲突生成依赖 gpt-5.4-mini,公开了设置但具体随机种子与全部原始日志需查仓库。整体上:协议、指标、Prompt(Figures 8–14 全部列出)描述详尽,方法层面可复现;数据与算力层面中等门槛;许可层面是主要障碍。
论文图表