个性化自动科研:迈向真正的AI合作科学家 Personalized Auto-Research: Towards a True AI Co-Scientist
提出个性化自动科研问题,让AI科研系统全程感知并适配研究者个体
前置知识
自动科研 / AI 合作科学家
指用大语言模型智能体端到端执行科研流程的系统:生成假设、检索并综述相关工作、设计并执行实验、撰写与评审完整论文。代表工作包括 2024 年的 AI Scientist(提出-实现-写作-评审闭环)、AI Scientist-v2(渐进式智能体树搜索+实验管理器)、Google 的 Co-Scientist、DeepScientist 等。
本文是对这类系统的批判与升级,不了解它们就无法理解“研究者无关”这一被指出的结构性缺陷。
研究者无关性(researcher-agnostic)
现有系统把每个科研阶段参数化为 $o_i = f_i(g, o_{<i})$,只依赖研究目标 $g$ 和此前阶段的输出,与请求者身份完全无关;同一目标下,一年级博士生和资深教授得到的输出分布一模一样,产出可互换。
这正是本文要修复的核心问题,全文的动机、形式化与算法都围绕“给 $f_i$ 加入研究者条件”展开。
异构科研图与图接地表示
论文用 $\mathcal{G}=(V, E_{\mathcal{G}}, au_V, au_E)$ 表示科研版图:节点包含研究者、论文、会议、机构、方法、数据集、主题等类型,边包含合作、引用、发表、隶属、使用等关系。通过编码器得到研究者的图表示 $z_u = \mathrm{Enc}_{\mathcal{G}}(u;\mathcal{G}) \in \mathbb{R}^d$。
驱动全流程个性化的上下文 $c_u = \Phi(S_u, z_u)$ 完全建立在图表示之上,这是整个方法框架的地基。
结构洞理论(Structural Holes)
社会学家 Burt 2004 年提出:占据不同社群之间“桥”位置的人更容易产出好想法。本文借用这一概念,把研究者版图中未被连接区域之间的空隙称为结构洞,认为对某个研究者最有价值的方向常常是跨接结构洞的桥梁,而非其本领域的自然延伸。
这是论文论证“个性化为什么会带来新颖性而非同质化”的核心社会学依据,图表示的价值正体现在能定位结构洞。
LLM 个性化与 LaMP/LongLaMP 基准
已有个性化研究(LaMP、LongLaMP 基准、偏好对齐、检索增强生成)证明:按用户历史记录定制语言模型的输出是可行且有益的,但个性化对象是单条回复或长文本生成结果。
本文的关键定位是区分“个性化一条输出”与“个性化整条科研决策序列”,理解这一区别才能抓住论文的独特贡献。
智能体树搜索(agentic tree search)
AI Scientist-v2 引入的搜索范式:把研究过程表示为部分研究状态构成的树,实验管理器选择节点,语言模型以一定分支因子扩展子状态,按效用函数打分排序,并配合代码执行与视觉语言图表评审,取代 2024 年版的线性模板流程。
本文的 Algorithm 1 就是在该范式上做个性化修改,理解树搜索才能看懂算法第 5–15 行的假设搜索过程。
研究动机
现有 AI 科研系统——AI Scientist(2024)、AI Scientist-v2(渐进式智能体树搜索)、Google 的 Co-Scientist、DeepScientist、Agent Laboratory、AutoResearchClaw 等——已能端到端地生成假设、检索文献、设计并执行实验、撰写论文,但它们全部是“研究者无关”(researcher-agnostic)的:给定同一研究目标 $g$,每个阶段被参数化为 $o_i = f_i(g, o_{<i})$,输出分布与请求者完全无关,一年级博士生与资深教授、图挖掘学者与计算生物学家拿到的是同一份研究包。质量只对任务、基准或评审模型优化,从不对将采纳结果的个体优化。作者指出三重代价:认识论上,科研能力大多是文献之外的隐性知识,条件化于文献的系统永远够不到;系统层面,众人查询同一通用引擎会把领域推向“科学单一文化”,大家重复赛跑同一个想法,而有反事实价值的方向无人问津;实践层面,研究者只会采纳与自身专长和资源匹配的方向。
本文的目标是本文提出“个性化自动科研”(personalized auto-research)这一新问题:把研究过程的全部阶段——文献检索、假设生成、实验设计、代码执行、写作、引用、修改、评审——都条件化在一个个体研究者表示 $c_u = \Phi(S_u, z_u)$ 上,即 $o_i = f_i(g, o_{<i} \mid c_u)$。期望输出满足三条标准:可行(feasible,匹配研究者的能力、资源与约束)、对齐(aligned,符合其学术身份、所在社区与写作风格)、新颖(novel,相对领域是新方向且区别于其已有工作)。作者主张个性化不是便利层,而是让 AI 从通用仪器变成真正“合作科学家”的根本性质,并给出通用框架 Algorithm 1 作为问题解法蓝图。
与已有工作不同的是,论文最独特的切入是指出个性化与自主性是两条正交的轴(Table 1):现有系统沿自主性轴推进(全自动的 AI Scientist、DeepScientist,或人在环的 Co-Scientist、AutoResearchClaw),但全部停留在“研究者无关”一列;右列——交互能够更新个性化表示的“真正 AI 合作科学家”——是空白象限。与个性化语言模型工作(LaMP、LongLaMP、偏好对齐、RAG)相比,被个性化的对象从一条回复升级为端到端科研决策序列(检索什么、假设什么、跑哪些实验、如何写作与修改);与 scientist-in-the-loop 系统相比,个性化要求的是持久的、学到的表示,捕捉科学家无法在提示词里说清的隐性知识,而非会话结束即蒸发的手动引导。作者还引入结构洞理论:最有价值的方向常是研究者所处社群与邻近未连区域之间的桥。
核心方法
论文把个性化形式化为对 SOTA 智能体科研循环(树搜索、实验管理器、代码执行、图文评审、写作、评审、溯源日志)的全链路修改。形式化上:从异构科研图 $\mathcal{G}$ 编码研究者得 $z_u = \mathrm{Enc}_{\mathcal{G}}(u;\mathcal{G})$,再与观测信号 $S_u$(论文、引用、代码、评审史等)融合为上下文 $c_u = \Phi(S_u, z_u)$,随后每阶段输出变为 $o_i = f_i(g, o_{<i} \mid c_u)$。检索打分为 $s_u(d \mid g) = \langle \eta(d), ho(g, c_u) angle$,取 Top-$k$ 得证据集 $\mathcal{R}_u(g)$;假设按效用 $U(h \mid g, u) = ?lpha\,\mathrm{Nov} + ?eta\,\mathrm{Rel} + \gamma\,\mathrm{Feas}$ 排序,三项分别是个性化新颖性、相关性、可行性。整体愿景围绕三大组件:图接地的研究者表示、贯穿全流水线的个性化、以个体为基准的评估。
核心创新有二。其一,公式 (2) $o_i = f_i(g, o_{<i} \mid c_u)$ 把“研究者”变成每个阶段的一等条件变量,而现有系统的 $f_i$ 只见目标不见人,这是从“仪器”到“合作者”的分界线——仪器返回高质量输出,合作者返回为特定的人量身定制的输出。其二,公式 (4) 的用户条件化效用函数用连续的个性化新颖性/相关性/可行性加权排序,取代现有系统的二元全局新颖性过滤器:同一个想法对某研究者不可行、对另一个显而易见、对第三个却因其图位置而具有变革性,这正是通用系统抹掉的异质性。设计原则是“个性化 how 而不收窄 what”:利用研究者画像判断可行性与框架表述,但保持候选空间开阔,把利用(延伸其轨迹)与探索(用画像评估可行性)分开,避免个性化退化为“预测更多同款”的推荐器。人类反馈也被折叠进 $S_u$ 重新编码为 $c_u$,跨会话持久存在。
方法步骤详情
Algorithm 1 共 27 行,分三段。上下文与文献接地(行 1–3):图编码器产出 $z_u$,融合观测信号 $S_u$ 得 $c_u$,检索按 $s_u(d \mid g)$ 取 Top-$k$ 得 $\mathcal{R}_u(g)$。假设搜索与实验(行 5–15):进行 $N$ 轮树搜索,管理器 $\mu$ 选择节点,模型 $\pi$ 以分支因子 $b$ 扩展,生成假设 $h$ 按效用 $U(h \mid g, u)$ 打分,实施代码 $C$ 并在预算 $B$ 内执行得 $O$,评审器 $\omega$ 审查图表 $F$,管理器打分 $q_u$;行 17 允许人类批评并更新 $c_u$。包合成(行 20–27):对 Top-$m$ 状态写作 $y$、引用精修、评审 $v$,产出研究包 $Q_u = (h, U, C, O, F, y, v, \Lambda_u, c_u, \mathcal{R}_u(g))$,$\Lambda_u$ 记录溯源。团队扩展把 $u$ 换成子图 $T$:聚合得团队上下文 $c_T$,可行性取成员最大值、对齐取最小值,实验路由给可行性最高的成员。
技术新颖性
技术新颖性体现在四个层面。问题层面,这是对个性化自动科研的首次形式化(定义 3.1),明确个性化对象是端到端科研轨迹而非单条输出,并证明个性化与自主性维度正交。表示层面,提出从科研异构图的多跳邻域学习 $z_u$——合作者在做什么、扩展网络发表在哪、哪些主题与所在社区相邻——并借助结构洞定位高价值方向,而不是只用论文列表描述学术身份:发表列表相似的两个研究者,一个身处理论家密集簇、一个桥接计算生物学,身份截然不同。机制层面,把全局二值新颖性测试换成用户条件化连续效用 $U(h \mid g, u)$,并设想 $\mathrm{Nov}/\mathrm{Rel}/\mathrm{Feas}$ 与权重 $?lpha, ?eta, \gamma$ 可从修订记录、评审意见、弃稿对比等科研轨迹中拟合,可行性锚定在真实代码库、算力与数据集而非自述档案。评估层面,提出保真度+对比度协议:留出 $t$ 时刻论文、用此前记录构建 $c_u$,高保真且高对比说明 $c_u$ 携带个体信号,失败则证伪表示。
实验结果
这是一篇立场/愿景论文,未报告任何实验数值,其“结果”是概念性贡献。第一,给出个性化自动科研的形式化(公式 1–4 与定义 3.1),并用 Table 1 证明个性化与自主性正交:AI Scientist、DeepScientist、Co-Scientist、AutoResearchClaw 等现有系统全部落在“研究者无关”一列。第二,给出 27 行的 Algorithm 1,展示个性化如何穿透检索、假设搜索、实验、图文评审、写作、引用、评审全部阶段——甚至图表反馈也可依赖 $c_u$:图挖掘学者和生物医学合作者对同一量化结果需要不同的视觉编码与术语。第三,提出以个体为基准的评估框架:可行性对齐、盲评专家质量、多年期纵向影响力三层标准,外加可全自动从书目数据计算的保真度+对比度留出协议。第四,系统识别四大开放张力:创造力坍缩、生命周期冷启动、团队个性化的社会选择问题、无反事实真值的评估难题。文中还引用 AlphaFold(Nature 596, 2021)作为 AI 辅助高风险科学的先例。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 研究者表示验证(留出论文协议) | 保真度 Fidelity + 对比度 Contrast | 未实测(立场论文仅提出协议):留出 $t$ 时刻的论文,用此前的公开记录构建 $c_u$,检验系统能否恢复出接近该研究者真实所做工作的假设与实验路径 | 研究者无关系统(预期在同一概念上保持通用输出,作为对比项) | 可全自动从书目数据计算,首次为“个性化信号是否存在”提供可验证的评测方案 |
| 个性化研究方向推荐质量 | 可行性对齐 / 专家盲评质量 / 多年期纵向影响力 | 提出三层评估标准,但未给出任何测量数字 | 以“预测研究者下一篇论文”为代理指标(作者论证其为有缺陷的代理,会惩罚优于历史的好推荐) | 以多年期共同科研产出替代单篇模仿度,奖励反事实互补性方向 |
局限与改进
作者坦承的首要局限是评估无真值:每个研究者只留下一条被经费、导师、评审与偶然性塑造的历史轨迹,未被探索的替代方向之价值永远不会被记录;按与历史的相似度打分只会奖励模仿、惩罚更好的推荐,留出协议也只能确认 $c_u$ 携带个体信号这一必要条件,无法证明推荐方向是好的。其次,论文完全没有实验:没有数据集、没有 $z_u$ 的具体实现、没有算法组件的消融、没有任何算力成本分析。个性化树搜索要求在同一目标上为不同研究者维护不同的搜索树与证据集,计算开销可能随用户数成倍增长。可行性若锚定真实代码库与算力,存在马太效应风险——资源少的研究者会被持续圈定在“可行”的窄方向里,与打破单一文化的初衷形成张力。团队聚合中 max-可行性假设成员间无缝交接、把冲突偏好压成单一 $c_T$ 被作者自认为社会选择难题,多成员隐私也更难处理。
独立分析的弱点
第一,图接地表示天然偏向书目数据丰富的资深研究者,早期职业研究者信号稀疏,且论文自己承认此时目标函数本身随职业阶段改变,$\mathrm{Enc}_{\mathcal{G}}$ 需要显式的生命周期建模而非只调权重。第二,效用权重 $?lpha, ?eta, \gamma$ 与 $\mathrm{Nov}/\mathrm{Rel}/\mathrm{Feas}$ 的学习途径只是设想,“训练模仿模型再在其低似然处优化”的反事实互补性目标极易退化为纯粹特立独行,需要引入类似对比约束或人反馈的正则。第三,$\mathrm{Nov}(h, \mathcal{I}, c_u)$ 依赖对整个文献索引的反事实新颖性评估,而 LLM 的新颖性判断本身不可靠,这在自动评审文献中已被指出是系统性盲点。第四,个性化档案包含失败项目、弃稿、评审历史等高敏感数据,论文对隐私、同意与对抗性画像攻击仅一句带过,需要联邦学习或差分隐私方案。第五,个性化树搜索的算力成本未被讨论,工程上应研究跨用户共享搜索子树、再按各自 $c_u$ 重打分的近似方案以摊薄开销。
未来方向
作者明确列出的方向包括:为保真度/对比度协议与三层评估标准构建基准基础设施(作者称这本身就是一个重大缺失贡献);团队级个性化,即 $c_T = \Psi(\cdot)$ 聚合、跨成员实验路由、以及推荐其加入即可填补结构洞的合作者;用专家小组、多年纵向研究与反事实实验设计化解无真值评估;把个性化作为群体发现的去相关机制,奖励“通用模型与用户历史都不太可能生成、但该研究者能做且有价值”的方向。在此基础上可延伸的工作还有:用 GNN 与 LLM 混合编码器实现 $\mathrm{Enc}_{\mathcal{G}}$,在 OpenAlex、Semantic Scholar 类书目数据上先验证保真度与对比度;把 Algorithm 1 原型化到 AI Scientist-v2、Agent Laboratory 等开源系统上做小规模对照;研究随职业阶段自适应调整的目标函数,以及隐私保护的研究者画像学习与同意机制。
复现评估
作为立场论文,本文没有代码、数据集或实验,Algorithm 1 也只是伪代码级描述:编码器 $\mathrm{Enc}_{\mathcal{G}}$、上下文函数 $\Phi$、效用各分量如何计算均未给出实现细节,因此不存在严格意义上的复现。若要复现其愿景,需要书目异构图数据源(如 OpenAlex、S2ORC)、可执行的自动科研框架(开源的 AI Scientist-v2、Agent Laboratory、AgentRxiv 等)以及 LLM 与视觉语言模型的算力支持,门槛较高。相对可行的起步是只实现两处修改——个性化检索打分 $s_u(d \mid g)$ 与个性化效用排序 $U(h \mid g, u)$——然后在留出论文协议上测保真度与对比度;这一子集可全自动从公开书目数据计算,作者也明示它是验证个性化信号存在性的第一步,也是检验整篇论文核心论点是否成立的最小实验。
论文图表
左右对比图。左半(a)展示研究者无关设定:同一抽象研究目标 $g$ 经过 $f_i(g, o_{<i})$ 后,对每位用户输出完全相同的研究包 $Q$。右半(b)展示个性化设定:研究者 $u_1$ 位于密集网络簇,$u_2$ 桥接一个结构洞,二者分别被映射为 $c_{u_1}$ 与 $c_{u_2}$,同一目标 $g$ 由此产生不同的证据集、搜索轨迹与输出包,即 $Q_{u_1} eq Q_{u_2}$,各包分别在可行性、对齐度与新颖性上为该研究者的领域做了优化。
一张图道尽论文核心命题——同一目标下不同研究者应当得到不同产出,它是全文动机的直观总纲,也直接对应公式 (1)–(2) 的形式化,理解了这张图就理解了论文要解决的问题。
共 27 行伪代码,分三段:行 1–3 构建个性化上下文 $z_u$、$c_u$ 并检索个性化证据集 $\mathcal{R}_u(g)$;行 5–15 进行 $N$ 轮个性化树搜索——选择节点、以分支因子 $b$ 扩展、假设按 $U(h \mid g, u)$ 打分、实施代码并在预算 $B$ 内执行、视觉语言图表评审、管理器打分 $q_u$,行 17 允许人类批评并重新编码 $c_u$;行 20–27 对 Top-$m$ 状态写作、引用精修、自动评审,输出含溯源日志的研究包 $Q_u$。
这是论文唯一的具体算法,把“每个阶段都条件化在 $c_u$ 上”的口号落实为可实现、可逐行讨论的流程,也是未来任何复现或批评其计算成本的锚点。