引言AI4S 需要什么样的 Agent项目地址https://github.com/kakastudy/colulu-agents-main过去两年AI for Science从概念走进了真实世界——AlphaFold 破解蛋白质折叠、AI 驱动的药物分子筛选进入临床、大模型加速材料设计……但在这些宏大叙事背后每一位科研工作者都清楚真实的科研流程远比想象中琐碎。一个典型的场景计算化学研究者发现文献中某模型存在改进空间。他需要检索上百篇文献并交叉验证方法学、设计对照组实验、预估样本量与统计功效、编写并长时运行计算脚本动辄数小时甚至数天、将数字预测与物理实验结果逐点比对、根据失败结果修正假设——如此循环往复直到结论成立。最后还要把这一切打包成一篇图表可复现、结论可追溯、符合投稿规范的论文。这背后是三个长期被 AI4S 讨论忽视的硬需求长时科研计算不是问一句、答一句而是数小时到数天的长程运行需要检查点、监控面板与断点续跑反馈干实验计算与湿实验物理必须构成闭环失败与负结果同样是宝贵证据不能被丢弃可审计每一个结论都必须能追溯到文献、数据与代码否则无法获得同行信任。这正是 Colulu Agents 试图回答的问题。它的思路不是把科研流程做成一个个孤立的对话而是将科学发现过程系统化为一套写进灵魂soul.md的通用智能体工作流——从任务分型、文献体系、试验方案设计到数字模拟、湿实验对接、迭代决策与成果打包全部纳入一个可长时运行、可反馈迭代、可审计追溯的闭环。接下来的文章我们将从四个维度展开Colulu Agents 如何支撑 AI4S 的长时、反馈与证据治理需求AI4S 工作流的流程体系支撑这套流程的 Skill 体系以及一次真实的案例实践——soul.md 工作流从 v5.0 到 v6.1 的升级。第一章Colulu Agents 如何支撑 AI4S如果 AI4S 是一场马拉松那么大多数对话式 AI 工具只能陪你跑完前一百米。科研任务的真实形态是长时运行、反复反馈、全程留痕。Colulu Agents 的支撑能力正是围绕这三个关键词构建的。1.1 长时运行让 Agent 撑过数天的计算马拉松科研计算任务动辄运行数小时甚至数天任何一次崩溃都可能意味着全部重来。Colulu Agents 为此内置了一整套弹性执行机制检查点checkpoint-manager运行中的关键变量被周期性地物化保存即使进程崩溃也能从最近的检查点恢复而非从头再来监控面板run-dashboard任何预估运行超过 5 分钟的任务强制启动异步监控面板实时展示计算进度与状态——这条被写进了工作流铁规不是建议而是必须熔断降级workflow-monitor内置同步监控哨兵检测到 NaN、梯度冲突等异常信号时自动熔断保存现场并输出崩溃报告避免带病运行断点续跑notebook-compiler结果自动归集回可一键重跑的完整 Notebook配合自适应降采样、软超时与指数退避重试让 Agent 在资源波动中活着完成任务。图 1Colulu AI4S 支撑能力总览——四类能力如何覆盖科研全链条一句话小结长时运行不是等得起而是扛得住、断得起、续得上。1.2 反馈闭环干实验与湿实验互相校验纯数字工作流文献→数据→代码→报告只是 AI4S 的一半。真正的科研闭环要求数字预测与物理实验互相校验——这正是 Colulu Agents 把湿实验作为一等公民的原因干-湿闭环工作流在数字模拟与湿实验之间建立显式连接。湿实验阶段负责把数字假设翻译为可执行的实验指令实验协议、仪器脚本并接收实验返回的数据失败即证据所有湿实验结果——包括失败与负结果——全部入库作为后续迭代的依据失败分析按根因分类输出恢复建议干湿逐点比对实验结果与数字预测逐点比对偏差超过阈值自动触发根因分析是数据问题模型问题还是实验操作问题迭代决策每轮循环的停止/继续决策由迭代控制器基于数值指标 证据差距双驱动做出而非主观感受假设信念的更新被显式记录并附加元反思识别模式与认知盲区。一句话小结反馈闭环让每一次失败都成为下一次设计的输入而不是被丢弃的噪音。1.3 证据治理让每个结论都有出生证明AI4S 最大的信任危机来自编造——模型自信地输出一个看似合理的结论却没有任何来源。Colulu Agents 将系统的数据真实性规则升级为贯穿全链的证据真实性铁规来源与置信度一切产出试验方案、模拟结果、综述、结论必须标注来源用户文件/文献/数据/实验记录与置信度找不到可靠材料时必须明确声明未找到数据/证据严禁编造主张-证据审计核心论断必须绑定具体证据文献页码、数据行号、结果图号缺失证据的论断在审计报告中被标记为弱证据研究账本每张图、每个结论都有一份出生证明——记录生成代码、运行环境、输入数据版本、参数设置与决策依据全流程逐阶段登记批判性检查点在假设生成后、实验设计后、结果解读后、结论形成前四个关键决策点强制回答批判性问题可证伪吗对照组充分吗效应量有意义吗存在确认偏误吗。一句话小结可审计不是事后补文档而是每一阶段强制留下的决策痕迹。1.4 多智能体协同通才协调专家执行独立审核单个 Agent 很难同时精通文献、统计、建模与实验设计。Colulu Agents 采用三层多智能体架构协调层通才 Agent理解研究意图、任务分型、拆解子任务、调度 Skill 与子 Agent维护研究账本执行层专家子 Agent按需派生文献专家、数据专家、建模专家、实验设计专家等并行会话各自调用领域 Skill 专注执行审核层独立审核 Agent对关键产物做交叉验证——逻辑一致性、证据充分性、可复现性签发审核闸门。研究问题陈述、试验方案、干湿比对结论与最终报告都必须通过审核层的检查才能进入下一阶段——让评审成为流程的一部分而不是事后环节。一句话小结多智能体的价值不是多个模型聊天而是把科研中的分工与评审制度化。第二章AI4S 工作流流程体系第一章回答了Colulu Agents 凭什么支撑 AI4S本章回答AI4S 到底怎么跑——即把科学发现过程系统化为可执行、可审计、可进化的流程。2.1 Gate 0一切任务的第一道门——任务分型Colulu Agents 不会对帮我把这段 SQL 跑一下和帮我设计一个药物筛选实验使用同一套流程。任何请求进入工作流首先经过Gate 0 任务分型Track-A 传统任务非科研闭环数据分析、文档处理、SQL 查询、日常办公——走轻量 5 步解析 → 资产检查 → 执行 → 证据核对 → 交付归档去除科研强制项如 .ipynb 载体、长任务监控、论文级打包Track-B 科研全链条科学发现/研究闭环涉及假说、试验、文献体系、科研产出——走九阶段闭环。分型之后Track-B 还要进一步判别研究问题类型动态路由到不同的子工作流模板问题类型路由策略复现验证型严格锁定数据/代码/环境版本输出一致性报告数据驱动发现型强化数据治理与统计验证假设驱动实验型嵌入干-湿实验闭环方法开发型强化代码生成与基准测试强制与 SOTA 对比综述构建型强化文献体系与成果打包压缩数据/计算阶段图 2Gate 0 双轨流程全景——同一套系统两套流程五条路由一句话小结同一套系统、两套流程、五条路由——“轻任务轻做、重任务重做”。2.2 Track-B科研全链条九阶段闭环九阶段不是线性流水线而是一个可进可退的闭环从问题定义出发经过文献、设计、数据、模拟、湿实验、验证在迭代决策处回环直到证据差距消除才进入成果打包。Phase -1 问题定义(RQC 研究问题证书) → Phase 0 资产盘点与差距分析四维资产 gap 消除 → Phase 1 文献体系构建≥30 篇排序、方法学抽取 → Phase 2 试验方案设计参数溯源 对照组文献 统计功效 虚拟试验预演 → Phase 3 数据获取与治理科学表征标准化 → Phase 4 数字模拟/计算实验.ipynb 载体 检查点/监控/熔断 → Phase 5 湿实验对接与执行Safety Gate 失败五类分析 反馈入库 → Phase 6 结果分析与验证统计检验 领域规则 干湿逐点比对 证据审计 → Phase 7 迭代决策数值证据双驱动 信念更新 元反思 → Phase 8 成果打包与资产沉淀论文级交付 复现包 假说库回写图 3Track-B 科研九阶段闭环——从问题定义到资产沉淀的可进退闭环几个值得展开的设计Phase -1先定义问题再动手。用 PICO 等框架把模糊意图结构化产出研究问题证书RQC——包含原始定义、显式假设、机制模型、张力/矛盾点、可证伪假说、最小决定性实验与失败更新规则。可失败被显式写入规范连什么条件下算失败、失败后如何更新都要提前定义。Phase 2证据最强约束阶段。每个实验参数必须有文献或预实验来源parameter_justification.json对照组设计必须引用 ≥2 篇同领域文献统计方案基于文献效应量预估并且在花一分钱做湿实验之前先用模拟器跑一遍虚拟试验simulation_before_wetlab.json预判可行性与预期范围。Phase 5湿实验是一等公民。把数字假设翻译为可对接自动化平台的实验指令移液工作站脚本、PCR 程序通过 Safety Gate 安全门检查后执行所有结果——包括失败与负结果——全部入库失败按五类根因分析并给出恢复建议。Phase 6 → 7验证与迭代构成闭环。干实验结果与湿实验结果逐点比对偏差超阈值自动根因分析核心论断必须绑定证据claim 审计弱证据标记迭代控制器基于数值指标 证据差距双驱动决定继续/停止/调整信念更新与元反思被显式记录。Phase 8成果打包不是终点而是资产沉淀的起点。交付论文级报告按领域模板、可复现包并把假说库、知识空间回写——让本次研究成为下一次研究的资产。2.3 纪律层九条铁规 批判性检查点 审核闸门流程要真正可信光有阶段划分不够还需要不可违反的纪律。工作流定义了九条铁规其中四条最能体现设计哲学铁规 7 · 证据真实性最高优先级所有输出必须基于可靠材料用户文件/文献/数据/实验记录标注来源与置信度找不到证据时必须声明未找到严禁编造——这是 AI4S 信任的底线铁规 8 · 批判性检查点在假设生成后、实验设计后、结果解读后、结论形成前四个决策点强制自问可证伪吗对照组充分吗效应量有意义吗存在确认偏误吗铁规 3 · 代码必须进 .ipynb每个代码块标注# Asset:资产来源杜绝黑盒脚本铁规 6 · 归档三件套资产清单 主张-证据审计 研究账本缺一不可。此外关键产物研究问题、试验方案、干湿比对结论、最终报告必须通过审核闸门——由独立审核层交叉验证后才能进入下一阶段。2.4 SCI 级输出规范把合格变成可检查的契约科研产出是门面Colulu Agents 不依赖模型临场发挥而是把 SCI 要求参数化为契约图形必须 PNGSVG 双格式、300dpi、色盲安全配色、字号 ≥7pt报告按领域模板nature/acs/biomed/ai_ml生成骨架摘要 ≤200 词、三线表、编号引用每张图必须绑定出生证明三件套数据来源 生成代码 证据条目孤儿图一律拦截。一句话小结流程决定做什么铁规决定不做什么输出规范决定做成什么样。第三章Skill 体系——AI4S 的技能/工具库流程定义了做什么但真正让 Agent 会做科研的是一整套按阶段构建的Skill 体系。本章讲清楚三件事构建了哪些 Skill、整体是怎么通盘考虑的、以及这套体系如何自我生长。3.1 构建思路从手写代码到Skill 优先一个朴素的问题为什么不让 Agent 直接写代码、画图、跑流程而要额外构建几十个 Skill因为科研要求可复用、可审计、质量稳定——而临场手写恰恰做不到这三点每次生成的代码风格不一、无法沉淀为团队资产、质量依赖模型发挥。v6.1 工作流因此确立了Skill 优先纪律Agent 在每个阶段不得直接用底层工具手写实现而必须先load_skill加载对应 Skill再按 Skill 文档执行。这背后是一套四级调用策略P0–P3P0 资产检查list_skills()/search_skills()/search_space()先行——先看有什么避免重复造轮子P1 Skill 执行load_skill(slug)按文档执行——标准路径P2 动态构建缺失时用skill-creator现场创建并注册P3 底层工具仅当 Skill 文档明确指示时才直接使用 write/bash。通盘考虑的一句话总结流程驱动、分层建设、契约下沉、自举生长、领域可插拔。3.2 一张大表看全为 AI4S 构建的 Skill 全景以下是 v6.1 工作流与 Skill 体系的完整映射。表格同时回答两个问题构建了哪些Skill 列与如何通盘考虑定位/职责与状态列——先建核心按需补齐细节流程阶段构建的 Skill定位 / 职责状态贯穿全局web-search / knowledge-rag / markdown-wizard / code-reviewer / file-converter通用基础能力检索/知识/写作/审查/转换已注册Gate 0 分型task-profiler任务分型路由Track-A/B 五类研究问题判别按需构建Phase -1 问题定义claim-auditor研究问题证书RQC审核闸门、证据审计按需构建Phase 0 资产盘点data-viz / gap-analyzer / skill-creator / />图 5Colulu Agents 产品中的【Skill Tools】界面——已注册 Skill 与工具的集中管理视图统计表格共覆盖30 个 Skill其中约 20 个为已注册核心技能10 个为按需构建提案带 * 标记——先建核心、按需补齐避免过度建设。图 6科研 Skill 生态图谱——按流程阶段组织的 Skill 能力域拓扑3.3 自举Skill 生态的自我生长这套体系最特别的一点是能自己长出新 Skill。当 Phase 0 差距分析发现某个环节没有对应技能时Agent 不依赖人工补丁而是load_skill(skill-creator)读取构建规范编写新 SKILL.md 并注册到技能库新资产必须附带存活期标签如expires_after或scope过期自动回收避免技能库膨胀。先检索、后构建是铁律——绝不在已有能力时重复造轮子。图 7Skill 自举与五类扩展接口——缺什么造什么且按领域可插拔3.4 五类扩展接口与领域适配一套流程四大学科领域特异性通过五类扩展接口注入专用技能、数据适配器、工作流模板、校验规则库、领域本体/输出模板——均遵循先检索、后构建原则。核心流程不随领域改变变化的是四件套本体/术语医药 CTCAE、化学 SMILES、生物 GO、AI 基准集、工具/Skill 示例、验证规则库PK/PD 边界、反应动力学、生理约束、数据泄露检测、输出规范模板biomed/acs/nature/ai_ml。同一个九阶段流程医药、化学、生物、AI 四大学科各取所需。一句话小结Skill 体系的价值在于把会做科研从模型的天赋变成了系统可复用、可审计、可生长的资产。第四章案例研究4.1 生态环境学科学研究案例螺旋藻多因子耦合胁迫机制分析4.1.1 案例概览维度内容科学问题高强度光照 高温如何驱动 pH 升高与溶解氧过饱和进而对螺旋藻Spirulina platensis形成协同胁迫光抑制/氧抑制任务轨道Track-B 科研/干实验真实现测数据无湿实验数据源数据空间藻类数据文档NASA 跑道池实验数据algae_data.mat12.8 MBReadme.pdf核心方法条件 Granger 时滞因果网络 SEM 路径分析 分段回归/临界阈值识别核心结论光照对生长的抑制以间接路径为主占 73%DO 断点 376 μmol/L、pH 断点 9.85交付物6 张论文级图 7 页 SCI PDF 报告 监控面板 研究账本 主张-证据审计4.1.2 第一环 · 计划先想清楚再动手Gate 0 → plan.md以藻类生物过程工程专家身份发起任务要求围绕光照-温度-pH-溶解氧DO多因子耦合胁迫机制展开分析并明确三项要求构建多变量时滞因果网络Granger、用结构方程模型量化路径系数SEM、识别临界条件阈值。系统没有立刻开始跑代码——这正是 v6.1 工作流与普通问答式 AI的分水岭。它先完成三件事任务分型Gate 0识别出这是涉及假说、因果推断与科研产出的 Track-B 任务生成research_question_profile.json锁定数据驱动发现型 假设驱动实验型的混合路由问题定义Phase -1把用户的模糊意图结构化为三条可检验的因果链——(a) 光照→pH光合耗 CO₂ 致碱化(b) 光照/温度→DO光合放氧© DO/pH→生长速率 μ高氧高碱胁迫资产盘点Phase 0search_skills在 52 个已注册 Skill 中匹配到publication-styleSCI 输出契约、academic-searcher文献检索等并核实数据空间真实文件结构——.mat含 3 个跑道池、约 7.6 万点 5 分钟高频辐照度与 7.7 万点水温、以及低频的 pH/溶解氧/OD 观测。随后系统提交研究计划plan.md含数据接入、三大任务、可视化交付与诚实约束六条经用户确认后才进入执行——这是全流程第一个 HITL 检查点。图 8第一环 · 计划——产品中的研究计划界面任务分型、九阶段计划与用户确认4.1.3 第二环 · 论文研究站在最新研究的肩膀上Phase 1.1计划确认后系统没有凭经验拍脑袋定方法而是先做文献方法学研究——这呼应了第二章 Phase 1 的文献体系构建也是 AI4S 与普通数据分析最本质的区别academic-searcher聚合 arXiv / Crossref / Semantic Scholar 检索真实文献元数据产出literature/method_review.md141 条真实记录从检索结果中提取方法学创新点其中最关键的一条PCMCIRunge et al., 2019,Science Advances的共因控制思想——为后续的条件 Granger 方法创新提供了依据遇到 arXiv / Semantic Scholar API 限流HTTP 429时系统如实记录未获取的文献绝不虚构。图 9第二环 · 论文研究——文献检索、方法学评审与创新点提取界面4.1.4 第三环 · 方法设计把科学问题翻译成可执行方案Phase 2论文研究产出方法依据后系统把三个任务细化为可执行的方法设计并做出四项关键决策任务方法设计关键决策时滞因果网络逐池 Granger 因果检验滞后期 3–5 天AIC/BIC 选阶条件 Granger先对温度/pH 残差化再检验借鉴 PCMCI 共因控制路径量化semopy 显变量路径模型外因光/温 → 中介pH/DO → 内因μ显变量 SEM规避潜变量求解器限制引入 PAM0 作混淆协变量阈值识别分段回归BIC 选段 样条验证 三维响应曲面拐点可操作化DO 红线、pH 警戒线数据预处理5-min→日重采样、低频插值、DO 饱和计算APHA/Mortimer 公式弃用产生天文数字的 Weiss 公式图 10第三环 · 方法设计——研究方法的整体框架图数据接入 → 因果网络 → 路径量化 → 阈值识别4.1.5 第四环 · 执行与真实数据斤斤计较Phase 1a–4方法既定进入真刀真枪的执行。这一环考验的是工程韧性与统计严谨性日面板构建高频辐照度/水温重采样为日尺度日均、日最大、光累积量低频 pH/DO/OD 线性插值补齐gap 上限 8 天超出置 NaN 并诚实标注通过 OD 曲线识别 day 20–130 稳定生长期产出 780×25 的panel_daily.csv——稳定期 DO 饱和度长期处于223–236%2–3 倍过饱和任务一 · Granger光照→DO 因果显著滞后 2 天p0.013/3 池一致而条件化后显著性下降p→0.089揭示部分光→氧链源于与温度/pH 的共变——这不是失败而是方法价值的体现系统看清了因果结构的全貌任务二 · SEMn378路径标准化系数解读pH → μ−0.52(p0.001)高碱胁迫是生长抑制的核心中介光照 → μ 直接−0.09不显著直接光抑制证据弱光照 → μ 间接经 pH/DO−0.25主要胁迫路径光照 → μ 总效应−0.34间接占73%任务三 · 阈值分段回归 样条验证得到两个可操作拐点——DO 超过 376 μmol/L约 270% 饱和度后生长速率转降pH 超过 9.85 后抑制斜率从 −0.068 恶化到 −0.176抑制增强 2.6 倍。呼应第二章这三个数值就是这项研究交付给工程世界的答案——跑道池的 DO 控制红线与 pH 警戒线。4.1.6 第五环 · 结果交付从图表到论文Phase 5–8执行完毕系统进入门面工程阶段——每一张图都经过publication-style契约与质量门检查呼应第三章的 Skill 体系6 张论文级图多因子日面板全景、Granger 因果 DAG、SEM 路径系数图、阈值响应曲线、三维响应曲面、方法框架图——全部遵循 Okabe-Ito 色盲安全配色、≥7pt 字号、300dpi PNG SVG 双格式SCI PDF 报告7 页1.27 MB一页式结果信息图 实时研究监控面板research_dashboard.html双账本归档research_ledger.md逐阶段输入/方法/产出/决策claim_evidence_audit.md6 条核心结论 C1–C6 逐一绑定证据与置信度如DO 断点 376 μmol/L标注为中置信度并注明分段线性假设的局限——呼应第二章的出生证明三件套。图 11第五环 · 结果交付——一页式结果信息图从 6 张论文级图到可传播的科研信息图图 12第五环 · 结果交付——7 页 SCI 级 PDF 报告按领域模板生成的论文式交付4.1.7 五环启示AI4S 能力的一次完整兑现回看这条计划 → 论文研究 → 方法设计 → 执行 → 结果交付链条每一环都对应前文的一项设计计划与论文研究——Gate 0 任务分型、Phase -1 问题定义、Phase 1 文献体系先想清楚、先看文献再动手呼应第二章 2.1–2.2方法设计——从最新研究PCMCI中汲取方法创新而不是重复教科书的套路呼应第二章方法学抽取执行——长时运行十余个脚本、数十次工具调用中途会话恢复仍能接续、反馈闭环条件 Granger 的显著性回落成为新认识负结果同样是产出呼应第一章 1.1–1.2结果交付——Skill 体系即生产力publication-style/academic-searcher/paper-info-extractor按需加载、证据治理落地每个数值可定位到数据文件与分析脚本连Weiss 公式不可用都写进账本呼应第三章、第一章 1.3诚实的局限——研究账本明确记录插值自相关膨胀、三池共享环境光温、文献 API 限流未虚构一个会承认自己局限的系统才配得上科研协作伙伴的位置。4.2 生命科学单细胞组学案例人类胚胎骨骼发育的新颖转录因子发现另一种同样重要的能力——当数据缺席时系统如何守住证据真实性的底线再在数据到位后把完整流水线跑通。4.2.1 案例概览维度内容科学问题在人类胚胎骨骼谱系分化过程中自主发现此前未被充分报道的关键转录因子TF任务轨道Track-B 科研/干实验数据驱动发现型 BIOMNI 生物科研编排 Skill输入数据用户描述约 33.6 万细胞核snRNA-seq snATAC-seq但数据路径为占位符实际未提供替代真实数据Human embryonic limb cell atlasZhang et al.,Nature2023, DOI 10.1038/s41586-023-06806-x102,324 细胞核心结论发现 NKX3-2、OSR2、FOXC1、OSR1 等高活性、低文献密度的候选新 TF已知主控因子RUNX2/SOX9/SP7作为方法学阳性对照验证准确交付物候选 TF 优先级表 UMAP/轨迹/网络/活性全套图 中英文双版报告 证据审计C1–C84.2.2 第一环 · 计划把找新因子变成可证伪的假设Gate 0 → plan.md以 BIOMNI 生物科研编排 Skill AI4S 发起任务。系统先做问题结构化——用 PICO 框架定义人群骨骼谱系细胞、干预TF 调控活性变化、对照不同发育阶段与细胞类型、结局高活性但低文献密度的候选 TF并显式写下可证伪假设 H1与失败条件H1存在一批 TF其调控网络活性在成骨/软骨谱系分化轨迹上显著上调且染色质可及性支持直接调控其中若干在 PubMed/综述文献中研究密度显著偏低。失败条件若所有高活性 TF 均为 SOX9/RUNX2/SP7 等已知因子或活性上调无染色质证据则 H1 不成立。随后规划 7 步分析流程预处理整合 → 图谱构建 → 轨迹推断 → 调控网络 → TF 活性评估 → 新因子筛选 → 成果打包并把每个参数质控阈值、n_pcs、分辨率、批次校正算法都登记来源——参数不再拍脑袋。图 13第一环 · 计划——PICO 结构化研究问题、可证伪假设与 7 步分析流程4.2.3 第二环 · 论文研究 第三环 · 方法设计生物领域编排的专业性Phase 1–2本案例的方法层由生物专用 Skill 体系支撑展示了第三章领域适配四件套在真实任务中的形态biomni-orchestrator生物科研编排 Meta-Skill覆盖选题立项→文献调研→实验设计→数据获取→分析统计→结果解读→论文撰写七阶段流程作为领域调度中枢路由本次任务b-repl-bio科学计算 REPL提供持久化的 Python 计算环境自动捕获 PNGSVG 双格式图≥300dpi方法设计批次校正用 Harmony 计划、Windows 构建失败后等价替代为 scVI诚实记录而非隐瞒TF 活性评估采用 chromVAR/SCENIC 代理法并明确标注其局限新因子判据定义为novelty 谱系活性delta × 文献稀有度。图 14第三环 · 方法设计——研究框架图数据接入 → 质控整合 → 图谱/轨迹 → 调控网络 → TF 活性 → 新因子筛选4.2.4 关键转折 · 数据阻塞宁可交付空管道绝不编造数据Phase 0这是本案例最值得写进博客的一幕。任务发起时数据路径字段是占位符[请在此处提供你的数据存储路径]——从未被填写。系统没有假装有数据而是做了一次教科书式的真实性调查调查项结果本地全盘搜索.h5ad/.h5/.mtx/.rds 等❌ 未找到任何数据文件已连接数据空间 / 知识空间❌ 无单细胞数据集CELLxGENE Discover387 个 collection❌ 无人胚胎骨骼发育多组学33.6 万核 snRNAsnATAC精确匹配PubMed/Crossref 检索⚠️ 仅找到同类近邻研究无法唯一确定可下载的精确匹配集结论写入了STATUS_DATA_BLOCKER.md并掷地有声地声明“我绝不能伪造 33.6 万个细胞核的 snRNAsnATAC 数据再据此绘制 UMAP、伪时间轨迹、TF 活性热图并冒充’真实分析结果’——那等同于数据造假。”同时给出三条路径A 提供本地数据最快、B 提供公开数据集标识符、C 交付空管道 可复现模板包严格标注为脚手架不冒充结果。呼应第二章铁规 7证据真实性找不到数据就明确说未找到——这是 AI4S 信任的底线也是本案例与 4.1 同样重要的能力展示。4.2.5 第四环 · 执行挂载真实公开数据把流水线真正跑通Phase 1a–4用户授权继续执行后系统选择路径 B 的变体——检索并挂载了真实公开数据Human embryonic limb cell atlasZhang et al.,Nature2023并如实标注该数据为 102,324 细胞与用户描述的 33.6 万核规模不一致这一差异作为局限 D3 记录绝不默认两者等价。随后完整跑通全部任务质控与整合102,324 细胞、25,769 基因Ensembl→HUGO 映射 21,162 个图谱构建Leiden 28 clusters、34 类细胞注释其中骨骼谱系细胞 50,966 个49.8%并发现远端区含更多软骨/骨化前沿细胞符合近心端→远心端骨化规律轨迹推断Mes间充质→ OCP成软骨成骨祖细胞→ 软骨细胞系 → OsteoB成骨细胞的连续分化轴调控网络37 个候选 TF 与标志性靶基因的共表达网络31 条边RUNX2/SP7/SOX9 与其经典靶基因强共表达验证方法学准确TF 活性评估41 个 TF × 14 类细胞。分化后期活性最强的 IHH、DLX5、SP7、MEF2C、RUNX2、SOX9与已知骨/软骨主控因子完全吻合——这是最有力的方法学阳性对照。图 15第四环 · 执行——UMAP 上的骨骼谱系分化轨迹Mes → OCP → 软骨系 → 成骨4.2.6 第五环 · 结果交付候选新 TF 与多版本报告Phase 5–8最终交付物包含核心发现——候选新转录因子优先级表高活性 × 低文献密度优先级转录因子谱系活性PubMed 计数提示★1NKX3-20.59软骨仅 39人类胚胎骨骼谱系中几乎未研究★2OSR2−0.40间充质仅 30极低文献★3FOXC10.57软骨389骨骼形态发生候选★4OSR1−0.67间充质157骨骼前体调控候选…TBX15 / MEIS2 / ZIC2 / FOXC2—40–294低文献候选报告在证据审计层面保持了同样的严谨核心论断 C1–C8 逐一绑定证据定位与置信度如候选 TF 的新颖性标注为统计与文献层面证据并显式列出不升格为结论的局限——D1 无 snATAC 染色质直接证据、D2 无功能干预实验、D3 数据规模与任务描述不一致。交付形式包括中英文双版研究报告、候选 TF 表、全套图表与复现包全部过出生证明三件套登记。图 16第五环 · 结果交付——研究过程信息图从数据阻塞到候选新 TF 的完整过程第五章结语与展望——把做科研做成可复现的流程5.1 四个答案Colulu Agents 如何支撑 AI4S问题答案案例佐证凭什么能撑起长时科研检查点、监控面板、熔断降级、断点续跑——长时运行不是等得起而是扛得住、断得起、续得上螺旋藻案例十余个脚本、数十次工具调用的长链执行凭什么能形成科研闭环干-湿实验互相校验、失败即证据、数值证据双驱动迭代——每一次失败都是下一次设计的输入条件 Granger 的显著性回落成为新认识凭什么让结论可信证据真实性铁规、主张-证据审计、研究账本、批判性检查点——每个结论都有出生证明两案例的 claim-evidence 审计与诚实局限声明凭什么适配不同学科Skill 优先、自举生长、领域四件套注入——同一套流程医药/化学/生物/AI 各取所需胚胎骨骼案例的 biomni 生物编排 Skill5.2 两个案例的双重验证两个真实案例恰好构成了一次完整的能力-底线验证数据在位螺旋藻12.8 MB 真实数据 → 7 页 SCI 论文DO 断点 376 μmol/L、pH 断点 9.85全部数值可溯源到数据文件与脚本数据缺席胚胎骨骼系统拒绝编造 33.6 万个细胞核先交付诚实报告 空管道再在真实公开数据Nature 2023102,324 细胞到位后把全流程跑通发现 NKX3-2、OSR2 等高活性低文献候选 TF。两种情境同一条底线证据真实性。这正是 Colulu Agents 与其他看起来很像的 AI 工具之间最本质的差别——它不会为了让你满意而制造一个没有来源的结论。5.3 展望AI4S 的下一个台阶以 AI4S 工作流为基线值得期待的方向至少有三个更深的多智能体协作协调-执行-审核三层架构已经验证可行下一步是让专家子 Agent 在更长的时间尺度上并行推进多个子课题审核层以更细粒度的证据 DAG交叉验证更强的领域纵深从四件套注入走向领域原生 Skill 生态——正如生物领域的 biomni 编排每个学科都能长出自己的一整套方法论 Skill并随项目使用持续进化更完整的干-湿闭环当湿实验自动化平台移液工作站、测序仪与工作流的 Safety Gate 直接对接数字假设 → 物理验证 → 数据回灌的闭环将从论文描述变为日常操作更聪明的自我进化评估体系Evaluation反哺工作流本身——每一次跑通的项目都在沉淀新的 Skill、新的规则库、新的假说库让系统越用越懂科研。结束语回到引言的问题AI4S 需要什么样的 Agent它需要能跑完马拉松长时运行能在失败中学习反馈闭环能为每个结论负责证据治理能学会任何新领域Skill 体系。更重要的是它必须在没有数据时敢于说没有——因为科研的信任从来不是靠模型自信堆出来的。Colulu Agents 用一套写进灵魂soul.md的工作流回答了这个问题Workflow 是科学方法流程Todo 是每一步的自检清单与任务分解——它想成为的不是更会写代码的助手而是把做科研这件事本身做成一个可复现、可审计、可进化的流程。当一个 AI 系统把诚实写进最高优先级铁规把可证伪写进研究计划把出生证明绑到每一张图上——它就不再是科研的旁观者而是科研共同体的一员。