同行投票式LLM智能体压力测试:信息流引发词汇趋同,分布式来源无匹配暴露优势 Peer-Voted LLM-Agent Stress Tests Find Feed-Induced Lexical Convergence but No Reliable Matched-Exposure Advantage for Distributed Sources
匹配暴露实验显示信息流使LLM智能体词汇趋同,但四账号协同攻击无立场优势
前置知识
LLM 智能体(LLM Agent)
以大语言模型为决策核心的自治程序,能观察环境、生成文本并采取行动。本文中每个智能体由人物设定(persona)驱动,在模拟社交平台上发帖、投票、更新立场与置信度,形成'发帖→点赞→排序→再阅读'的闭环行为回路。
本文研究对象不是单个模型的问答能力,而是 12 个智能体组成的群体在平台反馈回路中的涌现行为,必须先理解智能体的基本构成才能看懂实验设计与结局变量。
预注册(Preregistration)与确认性研究
预注册指在看到实验结果之前就冻结研究假设、协议与分析方案并公开。本文把 80 次探索性试验与 448 次确认性试验严格分开:先做小规模探索提出假设,再在查看任何确认性结局之前把协议写入 CONFIRMATORY_PREREGISTRATION.md,然后才跑大规模确认。
论文所有结论的强弱等级都取决于这一框架:词汇趋同是跨面板确认的结果,少数派压制被降级为'模型相关',不理解预注册就无法理解作者为何如此谨慎地表述。
匹配暴露(Matched Exposure)
比较两种干预时保证其他暴露量完全相同、只变化目标因素。本文中单账号与四账号攻击条件都恰好投放 60 次对抗性曝光(12 个诚实智能体 × 5 个后初始化轮次),feed 深度、攻击方向与论证提示词也全部固定,因此'distributed − single'对比只反映账号数量与消息实现方式的差异。
这是论文第二个核心问题的设计基石:不匹配暴露时,协调性效应与触达、消息量、定位等纠缠,观察数据永远无法把'账号数'单独归因。
块自助法与随机化检验
统计推断方法。块自助法把每个模型-主题-种子块作为不可拆分的重抽样单元,抽 20,000 次构建 95% 置信区间;配对符号翻转随机化检验则随机交换配对差值的正负号,非零对不超过 20 时穷举、否则用 100 万次确定性蒙特卡洛计算 p 值,另辅以双侧精确符号检验。
论文所有效应量与 p 值都由这两类方法给出,且作者强调推论单位是块而非单条生成帖,不理解这点会误读其统计功效并错误地把帖子当独立样本。
TF-IDF 余弦相似度
文本相似度度量:把每篇帖子转为词频-逆文档频率(TF-IDF)向量,用向量夹角余弦衡量相似程度,1 表示完全相同、0 表示无共同词汇。本文在每个试验内部拟合词汇表,计算 12 个智能体最终轮帖子两两余弦相似度的均值作为词汇趋同指标。
核心结果的因变量就是它,效应约 +0.008~0.011 个余弦单位——知道量纲才能判断这是'统计上极显著但实际幅度温和'的效应,而非观点完全趋同。
意见动力学(Opinion Dynamics)
研究群体观点如何随社会影响演化的经典模型族,包括 DeGroot 加权平均模型、Friedkin-Johnsen 模型与 Hegselmann-Krause 有界信任模型,用显式更新规则刻画观点收敛、极化或停滞。人类实验(如 Salganik 等人的音乐市场实验)也证明流行度信号能改变评价与消费。
本文把 LLM 智能体群体当作意见动力学的现代计算实例来检验:同伴点赞这类社会认同信号是否会像经典理论预测那样改变语言与立场,是论文动机的直接来源。
研究动机
现有 LLM 评估几乎都测量孤立模型的单轮响应或任务完成度,但平台环境是递归的:智能体生成内容、其他智能体反应、平台对信号排序、排序结果又塑造下一代内容,这个回路从未被单智能体基准覆盖。这使两个常见的平台风险断言悬而未决。第一,参与度界面(feed)常被视为内容的被动包装,但排序曝光可能在任何攻击者出现之前就已改变整个智能体群体的行为。第二,协调行动(多账号水军)常被默认比单个来源更有说服力,可在观察数据中协调性与触达范围、消息量、目标定位、网络位置完全纠缠,账号数量无法单独归因。Park 等人的 Generative Agents、Chuang 与 Yang 等人的意见形成与扩散模拟、以及 MOSAIC 等系统虽然证明了大规模人格条件化群体的可行性,但机制隔离与运行级可审计性仍是公开的评估难题。
本文的目标是本文构建 PV-SST(Peer-Voted Social Simulation Testbed,同行投票社会模拟测试台):一个完全留痕、确定性可复现、以配对机制检验为组织核心的 LLM 智能体社交平台,并在其上回答两个预注册的确认性问题。问题一:同伴排序信息流(按智能体自己生成的点赞数排序的往轮帖子)是否在四个主题、四个种子、七个模型变体上稳定改变群体行为?问题二:在对抗性曝光严格匹配为每试验 60 次的条件下,四个分布式来源是否比单一来源更能移动诚实智能体的立场?作者事先冻结主结局定义 $\Delta_{\text{align}} = \text{mean}(s_{\text{push}} y_{\text{final}}) - \text{mean}(s_{\text{push}} y_{\text{initial}})$ 与 PDI 判定准则(总体对比为正、四个核心模型族至少三个为正、至少三分之二主题为正),确保结论可证伪而非事后挑选。
与已有工作不同的是,独特切入在于三点的结合。其一,把社交反馈做成内生的:帖子、结构化投票、曝光记录、立场更新全部留痕,请求种子是试验种子、轮次、阶段与智能体序号的确定性函数,实现运行级审计与逐字节复现。其二,用配对设计做机制隔离:以完整的模型-主题-种子块为推论单元(共 112 块),绝不把成千上万条生成帖当成独立样本来夸大统计功效;同时用匹配暴露把'账号数量'从触达与消息量中剥离出来单独检验。其三,把探索与确认严格分层:80 次探索性试验(Qwen 3.5 2B 与 Llama 3.2 3B、单一平台政策主题)只用于提出候选机制假设,其全部痕迹虽公开但绝不作为确认性证据,防止用大样本回溯性洗白探索性选择。这与常见的大规模模拟论文直接报告汇总效应、把多种机制混在一起解释的做法形成鲜明对照。
核心方法
直觉上,PV-SST 是一个迷你社交平台实验舱:每次试验从 24 人角色池抽取 12 个诚实智能体,初始立场在从强支持(+3)到强反对(−3)的六个非中立等级上精确平衡、初始置信度统一 0.70,然后运行六轮。每轮流程为:智能体接收条件特定的反馈块(控制组只看主题;feed 组看五条按同伴点赞排序的往轮帖子;攻击组额外看对抗帖),随后输出不超过 180 字符的 JSON 结构化帖子并更新离散立场与置信度;接着每个诚实智能体对最多五篇帖子投 like/ignore/downvote;投票结果决定下一轮 feed 排序。确认性矩阵为四个核心模型族(Qwen 3.5 4B、Gemma 4 E4B、Ministral 3 8B、Granite 4 3B)× 4 主题 × 4 种子 × 4 条件 = 256 试验,另设三个更大变体(Qwen 3.5 9B、Gemma 4 12B、Ministral 3 14B)的 192 试验单独分析,共 448 次试验、112 个完整四条件块。攻击方向按种子平衡:种子 101/307 推支持,211/419 推反对。
核心创新是把'群体行为评估'做成可证伪的配对机制实验而非观察式模拟。本质区别有三。第一,协议冻结:确认性协议在查看任何结局之前写入 CONFIRMATORY_PREREGISTRATION.md,主结局、对比方向与 PDI 准则(总体为正、4 核心模型族至少 3 个为正、主题至少 2/3 为正)全部预先指定,杜绝花园小径式的选择性报告。第二,匹配暴露的协调性检验:单账号与四账号条件都恰好投放 60 次对抗曝光(12 智能体 × 5 个后初始化轮次),feed 深度、诚实投票者、攻击方向、论证提示词全部固定,唯一变化的是账号数量与跨观看者的消息实现——这在既有 LLM 社会模拟中没有先例。第三,推论单位是块不是帖子:所有推断以 64(核心)/48(扩展)个配对模型-主题-种子块为单位,用 20,000 次块自助、精确符号检验与配对符号翻转随机化(非零对 ≤20 穷举,否则 100 万次确定性蒙特卡洛)报告区间与 p 值,诚实面对'生成帖不是独立样本'这一事实。
方法步骤详情
第一步,初始化:每次试验从 24 人 persona 池抽 12 个诚实智能体,立场在 +3 至 −3 六个非中立等级平衡,置信度 0.70。第二步,逐轮生成:智能体接收条件特定反馈块——topic-only 控制只给主题;peer-ranked feed 在第 0 轮后展示五条按同伴点赞排序的往轮诚实帖;single 与 distributed 条件每轮每观众恰好一篇对抗帖加四篇有机帖,均投放 60 次对抗曝光,智能体输出 ≤180 字符 JSON 帖子并更新立场与置信度。第三步,同伴投票:每位智能体对最多五篇帖子投 like/ignore/downvote。第四步,排序反馈:点赞数决定下一轮 feed 顺序。第五步,结局测量:主结局为立场对齐变化 $\Delta_{\text{align}}$,次要结局含对立侧存活率、多数捕获与最终帖 TF-IDF 余弦相似度。第六步,统计与审计:以配对块为单位报告均值差、20,000 次块自助 95% CI 与符号翻转随机化 p 值;448 次试验全部完成,帖子解析失败率 0.26%/0.20%、投票 0.76%/1.05%,失败生成保留原立场。
技术新颖性
技术上这不是第一个 LLM 社会模拟器,其新颖性在于'紧凑 + 可审计 + 配对检验'的组合。与 Generative Agents 等大规模模拟相比,PV-SST 的反馈完全内生(点赞来自被试智能体本身而非外置打分器),且请求种子确定性可复现;与 MOSAIC 等干预研究相比,它用配对块设计与匹配暴露实现真正的机制隔离,把 feed 曝光、排序、账号数量拆开检验,并坦率承认 feed 对比捆绑了曝光与排序、分布式对比捆绑了账号数量与消息实现。方法论上还贡献了负结果与测量审计框架:探索阶段的误信息检测实验揭示'改述泄漏'(全关键词检测器零命中但原帖近乎复述)与'立场混淆'(极性盲嵌入相似度把反驳当成赞同),两个独立 LLM 立场裁判的端点标签一致率仅 43.6%(Cohen's $\kappa = 0.258$)且方向判断相左——作者因此拒绝为误信息干预排序。把失败测量公开留痕、坚持次级结局用名义 p 值并声明不做事后挑选,在同类工作中非常罕见。
实验结果
第一,唯一跨面板复现的是词汇趋同:相对 topic-only 控制,同伴点赞 feed 使最终帖 TF-IDF 余弦相似度在核心面板升 +0.0082(95% CI [0.0043, 0.0121],p=0.000105,n=64),扩展面板升 +0.0109([0.0069, 0.0151],p=0.000001,n=48);四主题层均值两面板全为正,幅度有模型差异(Gemma 4 E4B 略负)。第二,少数派压制不普适:核心面板对立侧存活率降 3.9 pp([−6.8, −1.6],p=0.0068),更大变体 −1.0 pp(p=0.50)不显著;核心效应集中于 Qwen 3.5 4B(−12.5 pp),Gemma 4 E4B 恰为零。第三,PDI 检验未通过:分布式减单账号对齐对比核心面板 +0.057([−0.009, +0.125],p=0.112)、扩展面板 −0.040([−0.113, +0.035],p=0.332),未过一致性准则(核心 2/4、扩展 1/3 为正)。质量:448 次试验全完成,35,616 篇确认帖、32,256 次投票调用,曝光审计全过。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 信息流效应:peer-ranked feed 对比 topic-only 控制 | 最终轮帖子 TF-IDF 余弦相似度(配对块均值差) | 核心面板 +0.0082 [0.0043, 0.0121],p=0.000105(n=64);扩展面板 +0.0109 [0.0069, 0.0151],p=0.000001(n=48) | topic-only 控制(零差异) | 两面板置信区间均不含零,4 个主题层在两面板内全部为正,是唯一跨面板复现的确认性结果 |
| 少数派压制:feed 对初始对立侧存活率的影响 | 对立侧存活率变化(百分点) | 核心 −3.9 pp [−6.8, −1.6],p=0.0068;扩展 −1.0 pp [−3.1, +0.4],p=0.50 | topic-only 控制 | 仅核心面板显著且集中于 Qwen 3.5 4B(−12.5 pp),更大变体不能复现,结论为模型相关而非普遍规律 |
| 协调性检验:四分布式来源对比单账号来源(匹配 60 次对抗曝光) | 立场对齐变化 $\Delta_{\text{align}}$ 的配对差(distributed − single) | 核心 +0.057 [−0.009, +0.125],p=0.112;扩展 −0.040 [−0.113, +0.035],p=0.332 | 单账号攻击 | 未通过预注册 PDI 一致性准则,分布式包无可靠立场移动优势(有价值的负结果) |
局限与改进
作者明确承认的局限:一是处理捆绑——feed 对比同时改变同伴帖曝光与点赞排序,只能确立'整个 feed 界面'的效应而非排序单独效应;分布式对比同时改变账号数量与消息实现方式,检验的是'分布式包'而非账号数本身。二是范围限制:只覆盖四个开放权重族与三个更大变体,不含闭源前沿模型;四个主题全部是平台政策类(AI 内容标签、高触达身份验证、时间序 feed 默认、个性化政治广告定向),健康、选举、娱乐等议题可能不同。三是推论边界:块自助与随机化把配对块当作可交换的模拟重复,112 个块不是 112 个独立平台;feed 次要结局的 p 值未做族错误校正;人类验证缺失(一次性多数线索诊断显示大模型异质性但无匹配的人类处理,计划中的 ChangeMyView 回放只用合成占位符实现)。我自己的观察:每帖限 180 字符、每轮每观众仅五条 feed、只跑六轮,都限制了对真实平台动态的近似;效应量级(+0.008~0.011 余弦单位)的实际意义解释空间大;四个种子对种子方差的覆盖有限。
独立分析的弱点
独立分析出的弱点:第一,缺少'无排序同伴 feed'对照组,曝光与排序的贡献无法分离——改进很直接,加一个随机排序 feed 臂即可完成机制分解。第二,立场测量完全依赖智能体自报的离散标签,而探索阶段已证明 LLM 裁判一致率仅 43.6%、$\kappa = 0.258$,立场标签本身可能含系统性噪声;改进方向是引入人工标注校准子集或经验证的 stance-aware 分类器作为联合结局。第三,效应量小(+0.008~0.011 余弦单位)且推论单位只有 64/48 个块,跨种子与跨主题外推能力弱;改进是把种子扩到两位数并预注册跨种子方差检验。第四,每个攻击方向只用一个固定论证提示词,分布式条件的'消息实现多样性'因此受限,可能低估真实水军网络中论证多样化的作用;改进是扫描论证多样性维度并允许对抗账号策略自适应。第五,无社交网络拓扑与推荐算法规制,feed 排序被简化为点赞计数,与真实平台差距大,可引入图结构与时变排序算法。第六,四主题全是审核政策类,效应方向可能依赖议题极化结构,需在健康、选举等敏感议题复制。
未来方向
作者提出的方向:机制隔离研究加入无排序同伴 feed 臂,把曝光与排序的贡献分开;用人工标注或经验证的立场感知结局替换表面匹配与未验证的 LLM 裁判;在人类平台做匹配暴露实验之前,先用测试台证伪或限定威胁模型;把 LLM 平台风险分解为 feed 曝光、排序、账号数量、消息多样性、触达五个机制,分别用配对运行级设计检验。基于成果可延伸的:一是把 PV-SST 接入前沿闭源模型并系统扫描规模曲线——本文已观察到 Qwen 3.5 从 4B 到 9B 效应方向翻转,规模与趋同/压制的关系值得专门研究;二是引入真实网络拓扑(小世界、核心-边缘)与水军占据网络瓶颈的场景,把论文要求'显式建模'的触达与网络位置变量纳入因子矩阵;三是延长试验轮数,研究词汇趋同的长期稳定性、饱和与扰动后回弹;四是把测试台用作审核策略上线前的安全预检与测量校准台,例如先校准误信息检测器再排序干预;五是构造人类-智能体混合群体,用小规模人类被试校准模拟到现实的迁移函数,弥补论文承认的'模拟到人类外推未标定'缺口。
复现评估
复现条件非常好。完整实现、冻结协议、配置、汇总表与论文源码在 GitHub(ranausmanai/synthetic-social-networks)公开;59,776 篇生产帖(448 次确认 + 80 次探索)及每次确认性帖子、同伴投票、曝光记录与智能体端点的原始痕迹在 HuggingFace 数据集(ranausmans/synthetic-social-networks)发布。生成与投票用 Ollama 运行开放权重模型(4B–14B),单张消费级 GPU 即可承载;请求种子是试验种子、轮次、阶段与智能体序号的确定性函数,理论上可逐字节复现。统计管线(20,000 次块自助、穷举/百万次蒙特卡洛随机化检验)在 112 个块上计算量很小。难度中等:需部署 7 个模型变体并完成 448 次试验 × 6 轮 ×(12 次生成 + 最多 60 次投票调用),主要成本是运行时间而非算力。注意事项:Ollama 版本与采样参数需固定(关闭推理 token),JSON 解析失败处理策略(保留原立场)必须与协议一致,否则 0.2%–1.05% 的解析失败率会引入偏差。
论文图表
列出确认性设计的全部因子水平:四个核心模型族(Qwen 3.5 4B、Gemma 4 E4B、Ministral 3 8B、Granite 4 3B)、三个预注册更大变体(Qwen 3.5 9B、Gemma 4 12B、Ministral 3 14B)、四个主题、四个种子(101/211/307/419)、四种条件,以及每试验 12 个诚实智能体、6 轮。
实验设计的完整参数表:256 个核心试验 + 192 个扩展试验 = 448、112 个完整四条件块都可由这张表推出,也标明了攻击方向的种子平衡方案。
报告六个对比(核心/扩展两面板 × PDI 对齐、feed 存活率、feed TF-IDF 相似度)的配对块数 n、配对均值差、95% 块自助置信区间与随机化 p 值,例如核心 feed TF-IDF 为 +0.0082 [0.0043, 0.0121],p=0.000105。
论文所有主要数字的权威来源,三条主结论(词汇趋同成立、少数派压制不复现、分布式无优势)的量化证据都汇总在此表。