148 项科研 Skills,给 AI Agent 装上科学工具箱
大家好,我是柳半夏。
现在让 AI 帮我们读论文,已经不算新鲜事了。
真正让人头疼的是下一步:让它查数据库、跑单细胞分析、做分子对接、核对临床变异,再把结果整理成一份能复查的报告。
聊两句很容易,把一条科研流程稳稳跑下来,完全是另一回事。
最近,我把 K-Dense-AI 开源的 Scientific Agent Skills 项目文档完整翻了一遍。
它不是一个新模型,而是一套给 AI Agent 准备的科研“操作手册”。
所谓 AI Agent,可以简单理解为:不只会回答问题,还能调用工具、读取文件、执行代码,并连续完成多步任务的 AI。
而单个 Skill(技能),就是告诉它什么时候该用什么工具、按什么步骤做、哪里容易出错的一组结构化说明。
这个仓库目前提供 148 项现成的科研与研究 Skills,覆盖生物学、化学、医学、药物发现、材料、物理、数据分析和科学写作等方向。
项目官方还称,这套 Skills 已被全球 16 万+ 科学家使用。

不是换模型,是给模型发操作手册
很多科研 AI 的问题,并不是模型完全“不懂”,而是它不知道实验室和计算流程里的那些细节。
比如,同样是做单细胞 RNA 测序分析,它要知道如何质控、去除双细胞、批次整合、细胞注释、差异表达和通路富集。
中间任何一步松掉,后面的漂亮图表都可能失去意义。
Scientific Agent Skills 的做法很直接:把成熟工具的文档、代码示例、适用场景、最佳实践和集成方法,整理成 AI 能发现、能调用的 Skills。
每项 Skill 通常以 SKILL.md 为核心。你可以把它理解成写给 Agent 看的标准作业程序。
工具怎么装、输入是什么、步骤怎么走、输出如何检查,都尽量提前说清楚。
所以它解决的不是“让模型记住更多知识”,而是另一个更实际的问题:
让 AI 少一点临场瞎猜,多一点照章办事。
这也是这个项目真正有价值的地方。
它遵循开放的 Agent Skills 标准,可用于 Cursor、Claude Code、Codex 和 Gemini CLI。
Google Antigravity、OpenClaw、Pi 等兼容工具也在官方支持列表中。
换句话说,这套科研能力不必绑死在某一个模型或客户端上。

148 项 Skills,到底能干什么
仓库的内容非常多,但如果只看数字,很容易看成一份工具名单。
我更愿意把它理解成四层科研基础设施。
第一层,是数据库入口。
项目提供面向 100+ 科学与金融数据库的数据访问能力。其中,统一数据库查询 Skill 覆盖 78 个公共数据库。
它还可结合 BioServices、BioPython、gget 等多数据库工具,连接 PubChem、ChEMBL、UniProt、ClinVar 和 COSMIC 等资源。
ClinicalTrials.gov、FDA、PDB、AlphaFold、KEGG 与 Reactome,也在项目列出的覆盖范围内。
这里的“100+”不是 100 多个互不相关的 Skills,而是通过统一查询、专用 Skills 和多数据库软件包形成的覆盖范围。
第二层,是分析工具。
仓库还为 70+ 常用 Python 科研软件包准备了优化 Skills。
其中包括 RDKit、Scanpy、scikit-learn、PyTorch Lightning、OpenMM 与 MDAnalysis。
scVelo、PyMC、Qiskit、TimesFM 等工具也在其中。
AI 原本也能临时查文档写代码。但有了这些 Skills,它会更早知道推荐流程、参数习惯和常见坑点,少走一些“代码能跑,科学上却站不住”的弯路。
第三层,是多步科研工作流。
以仓库给出的药物发现示例为例,任务可以从 ChEMBL 检索高活性 EGFR 抑制剂开始。
接着用 RDKit 分析构效关系,用 Datamol 生成候选类似物,再通过 DiffDock 进行对接。
随后,还可结合 PubMed 与 COSMIC 检查耐药机制和突变信息。
注意,这只是官方展示的工作流范例,不等于系统已经替研究者发现了一款可用新药。
每一步的输入质量、参数设置、结果复核和实验验证,仍然要由专业人员把关。
第四层,是科研表达。
它不只管分析,还覆盖论文检索、文献综述、科学写作、同行评审、引用管理,以及 PDF、Word、幻灯片、海报、科研示意图和信息图表制作。
这意味着,一条任务可以从“找数据”一路走到“出报告”。
挺猛,但也最容易让人高估。

对医学科研,真正省下的是连接成本
医学研究很少只靠一个数据库或一段代码完成。
以临床变异解读为例,官方范例会先用 pysam 解析 VCF 文件,再通过 Ensembl VEP 注释变异。
随后查询 ClinVar 的致病性、COSMIC 的肿瘤突变、UniProt 的蛋白信息和 PubMed 的病例证据。
最后,再查找可能匹配的临床试验并生成报告。
过去,这些步骤往往散落在不同网站、软件包和脚本里。
研究者真正消耗时间的,常常不是某一次点击,而是在工具之间搬运信息、统一标识、补齐证据链。
Scientific Agent Skills 想做的,就是把这些连接提前铺好。
同样的逻辑也适用于单细胞分析、多组学生物标志物发现、医学影像处理、数字病理、临床试验检索和药物安全分析。
它最适合的,不是完全不了解研究方法、只想“一键出结论”的人。
它更适合已经知道问题是什么,希望把重复步骤交给 AI 协助执行的研究者、数据分析师和科研工程师。
你懂科研,它负责搬砖;你不懂科研,它也不会自动替你补上方法学。
这条边界,必须说清楚。
我用同一段心电,跑了两遍
光讲“Skill 能减少乱猜”还是有点虚。
所以这次我补了一个可复现的医工交叉案例:可穿戴单导联心电里的 R 峰检测。
R 峰是每次心室除极时最突出的波峰。后续计算心率、心率变异性,甚至做异常节律筛查,都要先把它找准。
我使用 PhysioNet 公开的 MIT-BIH 心律失常数据库 100 号记录,选取 MLII 导联第 5–300 秒,共包含 365 个人工逐拍标注。
但原始记录比较干净,两种方法很容易都拿高分,看不出工程差距。
于是,我在同一段真实 ECG 上叠加了固定种子的可穿戴压力条件:电极接触衰减、0.28 Hz 基线漂移、60 Hz 工频、传感器噪声和三段运动伪差。
这不是伪造患者数据,而是在保留原始心搏与人工标注的前提下,模拟可穿戴设备常见的采集干扰。 两组方法拿到的输入完全相同。
匹配规则也提前固定:检测点距离人工标注不超过 ±100 ms,就算命中。
无 Skill 组只做一件事:直接在受干扰的原始波形上找局部最大值。阈值采用“中位数 + 3 倍 MAD 换算的稳健标准差”,再加 300 ms 不应期。
主要代码如下:
# No Skill:直接在原始 ECG 振幅上设阈值
threshold = median(raw) + 3 * robust_sigma(raw)
peaks = local_maxima(
raw,
threshold=threshold,
min_distance=0.30 * fs,
)
有 Skill 组按照仓库中 NeuroKit2 Skill 指向的 ECG 流程执行:先清洗,再检测 R 峰,最后做质量评估。
# With Skill:清洗 → QRS 增强 → 检测 → 质量评估
clean = highpass(raw, 0.5, fs)
clean = notch(clean, 60, fs)
qrs = bandpass(clean, 5, 15, fs)
energy = moving_average(diff(qrs) ** 2, 0.15 * fs)
threshold = median(energy) + 3 * robust_sigma(energy)
peaks = detect_and_align(energy, clean)
quality = template_correlation(clean, peaks)
两组都用了同一种“中位数 + 3 倍稳健标准差”规则。不同之处只在于:一个直接盯着原始振幅,另一个先按 Skill 把信号处理链补齐。

图中的波形部分展示 235–247 秒。这是脚本自动找到的“无 Skill 与有 Skill 错误数差距最大”的 12 秒窗口,用来让漏检看得更清楚。
但下方表格不是只算这 12 秒,而是统计完整的 5–300 秒。
| 方法 | 真阳性 TP | 误检 FP | 漏检 FN | 精确率 | 召回率 | F1 |
|---|---|---|---|---|---|---|
| 无 Skill:原始振幅阈值 | 292 | 0 | 73 | 100.0% | 80.0% | 88.9% |
| 有 Skill:完整处理链 | 365 | 0 | 0 | 100.0% | 100.0% | 100.0% |
差距非常直观。
无 Skill 组没有乱报,精确率仍然是 100%。但电极接触变差后,R 峰振幅被压低,固定在原始振幅域里的阈值直接漏掉了 73 个心搏。
有 Skill 组先去掉基线漂移和工频,再把 QRS 的快速变化转成能量包络。即使原始 R 峰变矮,形态变化仍然能被抓住。
它还多输出了一层质量证据:本次检测的 QRS 模板相关性中位数为 0.950,没有心搏低于文档所列的 0.6 质量参考线。

所以,Skill 带来的差别不只是“代码更专业”。
它把清洗、检测、回对齐和质量检查,变成了一条不会轻易漏掉的工作流。
安装只要一行,使用却不能图省事
如果你的 AI 工具支持 Agent Skills 开放标准,官方给出的跨平台安装方式是:
npx skills add K-Dense-AI/scientific-agent-skills
如果使用 GitHub CLI 2.90.0 或更高版本,也可以只安装某一项 Skill。比如只装 Scanpy:
gh skill install K-Dense-AI/scientific-agent-skills scanpy
仓库工具要求 Python 3.13+,并使用 uv 管理 Python 依赖。
官方列出的系统环境包括 macOS、Linux 和 Windows WSL2。不同 Skill 还可能需要额外软件包、API 密钥、外部服务权限或网络访问。
官方其实反复提醒:不要因为安装方便,就一口气把所有 Skills 全塞进去。
148 项 Skills 会带来大量上下文,也扩大了代码执行、依赖安装和外部访问的范围。
更稳妥的方式,是按课题挑选一个小组合。
比如,做肿瘤变异解读,可以从 VCF 解析、数据库查询、论文检索和临床报告几项开始,而不是先装下整座科研百货商场。
安装完成后,可以用中文直接描述任务。比如:
请尽可能调用已经安装的科研 Skills 完成下面的任务:
解析这份 VCF 文件,进行变异注释;
查询 ClinVar 与 COSMIC 中的相关证据;
检索 PubMed 中与该变异有关的研究;
把数据库事实、文献结论和你的推断分开呈现;
记录数据来源、查询日期、关键参数和失败步骤;
最后生成一份仅供科研讨论、不能替代临床诊断的中文报告。
这类提示有一个关键点:不仅告诉 AI 做什么,也要求它留下证据和过程。
最该看的,不是能力上限,而是权限边界
Skills 不是普通提示词。
按照项目自己的安全说明,它们可能指导 AI 执行任意代码、安装软件包、发起网络请求,并修改本地文件。
社区贡献的 Skills 即使经过审核与安全扫描,也不能保证覆盖所有风险。
仓库称会使用 Cisco AI Defense Skill Scanner 进行扫描,并大约每周更新安全结果。
但项目团队也明确承认:随着社区贡献增多,无法保证每项 Skill 都经过穷尽式审查。
所以在把真实课题数据交给 AI 前,至少要做四件事:
- 只安装真正需要的 Skills,并先阅读对应的
SKILL.md。 - 检查环境变量、外部域名与 API 权限,别把生产密钥和敏感数据随手放进去。
- 核对每项 Skill 的单独许可证。仓库整体采用 MIT 许可证,但单项 Skill 可能有不同条款。
- 人工复核代码、数据来源和科学结论,尤其是临床、药物和患者相关任务。
如果数据涉及患者隐私,还要先确认文件是否离开本机、第三方接口会接收什么内容,以及整个流程是否满足所在机构的伦理与合规要求。
项目还提供 K-Dense BYOK:一款可在桌面运行、由这套 Skills 驱动的开源 AI 共同科学家工具。
据项目介绍,它支持自带 API 密钥、选择 40+ 模型,并可把数据保留在本地;高负载任务也可以选择 Modal 云计算。
不过,“本地运行”不等于所有步骤都天然离线。数据库查询、网页搜索和部分平台集成依然需要联网。
科研 AI,开始从会回答走向会做事
我看完这个项目后,最大的感受不是“AI 科学家终于来了”。
而是科研 AI 的竞争,正在从模型会不会回答专业问题,转向它能不能接住真实工作流。
会找数据、会用工具、会记录过程,也知道什么时候必须把决定交还给人。
Scientific Agent Skills 还远不是自动科学发现的终点。数据库会更新,软件包会改版,Skills 可能出错,模型也仍然会产生幻觉。
但它至少把一个方向做得很具体:不是再造一个无所不知的聊天机器人,而是给现有 AI 配上一套可检查、可组合、可复用的科研工具箱。
对于研究者来说,最值得期待的不是“一键替我科研”。
而是终于能把那些重复、琐碎、跨平台的工作,交给一个更懂规矩的 AI 搭子。
会做事,比会聊天更接近科研生产力。
信息来源
- K-Dense-AI,Scientific Agent Skills 项目主页
https://github.com/K-Dense-AI/scientific-agent-skills - Agent Skills 开放标准
https://agentskills.io/ - K-Dense-AI,Scientific Agent Skills 安全说明
https://github.com/K-Dense-AI/scientific-agent-skills/blob/main/SECURITY.md - Cisco AI Defense,Skill Scanner 项目
https://github.com/cisco-ai-defense/skill-scanner - K-Dense-AI,K-Dense BYOK 项目
https://github.com/K-Dense-AI/k-dense-byok - K-Dense-AI,NeuroKit2 Skill 及 ECG 参考流程
https://github.com/K-Dense-AI/scientific-agent-skills/tree/main/skills/neurokit2 - Moody GB, Mark RG,MIT-BIH Arrhythmia Database,PhysioNet,版本 1.0.0
https://physionet.org/content/mitdb/1.0.0/ - Makowski D 等,NeuroKit2: A Python toolbox for neurophysiological signal processing,2021
https://doi.org/10.3758/s13428-020-01516-y
更多推荐

所有评论(0)