بنقرة واحدة
experiment-dataset-costing
估算实验和科研数据集所需资源、周期与成本。适用于:估算实验或训练数据集构建所需的人力、样本、试剂、设备、算力、采购和交付成本,用于预算规划与报价复核。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
估算实验和科研数据集所需资源、周期与成本。适用于:估算实验或训练数据集构建所需的人力、样本、试剂、设备、算力、采购和交付成本,用于预算规划与报价复核。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
在专利全景项目的环节 4/4(环节4)使用本技能。它会把环节2统计/价值信号、环节3标引体系(tech_breakdown / key_questions / patent_packages)以及 SaaS 回流的 tagged_pool 转化为技术演进路线、护城河/价值交叉解读,并生成自包含 HTML 洞察报告(report.html + report_manifest.json)。
用于专利全景项目的环节1。它构建专家级、限定领域、带主题锚点且去噪的检索配置,通过抽样验证每个分支的精度,并导出干净候选池和各分支检索式——这些是环节2(patent-panorama-insights-stats)的输入契约。统计、画像和核心专利召回属于环节2。
当用户需要基于 PatSnap 或智慧芽专利 MCP/API 数据开展专利全景、专利版图、竞争专利情报、技术路线图、组合规划、产品/R&D 策略项目时使用本技能——无论用户显式调用 /patent-panorama-insights(或 @patent-panorama-insights),还是用自然语言描述这类专利分析任务。本技能编排五层流水线:环节1检索与降噪(patent-panorama-insights-search)、环节2全景统计与价值挖掘(patent-panorama-insights-stats)、环节3标引体系推荐(patent-panorama-insights-tag)、客户 SaaS 工具中的人工标引交接,以及环节4有证据支撑的单文件 HTML 报告(patent-panorama-insights-report),并管理各层之间的检查点、人工标引交接、回滚和进度汇报。
用于专利全景项目的环节2。它消费 patent-panorama-insights-search(环节1)产出的已验证 `search_config.json`、`candidate_pool.csv` 和 `core_recall.csv`,生成全景统计(趋势、申请人格局、技术构成、竞品画像)、按分支组织的核心专利索引(默认采信环节1召回排序,仅在必要时做有边界的兜底核查)和价值信号交叉挖掘文件。所有统计直接从检索式聚合,不需要逐件专利标引。
用于专利全景项目的环节3。本 Skill 推荐标引体系,包括 4 列技术拆解表(≤40 个三级节点,彼此互斥)、≥10 个关键技术问题、≥10 个推荐专利包(每包≥3 个同族,六项推荐规则),并提供 20–30 条记录的标引示范和待标引导出文件。全量逐条标引在客户 SaaS 标引工具中完成,不在本 Skill 中完成。
持续监控ADC研发、临床、专利、交易与竞争事件。适用于:持续监控ADC或抗体药物的研发进展、临床证据、专利变化、许可交易和竞争事件,用于赛道预警和BD机会跟踪。
| name | experiment-dataset-costing |
| description | 估算实验和科研数据集所需资源、周期与成本。适用于:估算实验或训练数据集构建所需的人力、样本、试剂、设备、算力、采购和交付成本,用于预算规划与报价复核。 |
给定一个或多个药物靶点(或疾病领域),自动完成:
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
targets | List[str] | ✅ | 靶点名称列表,如 ["PD-L1", "4-1BB"] |
task_type | str | ✅ | 建模任务:regression / classification / generation / multi-target |
use_case | str | ✅ | 用途:academic(学术研究)/ commercial(商业产品) |
molecule_type | str | ✅ | 分子类型:small_molecule / antibody / fusion_protein / all |
output_language | str | ❌ | 报告语言,默认 zh(中文),支持 en |
max_patents | int | ❌ | SAR 提取最大专利件数,默认 20 |
调用 ls_ner_nor_normalize 对输入靶点名称进行标准化,获取靶点 ID、UniProt 号、别名等。
并行调用:
ls_drug_search(target=[...], highest_phase=["approved","phase_3","phase_2"]) — 统计已知活性药物数量ls_target_fetch(target=[...]) — 获取靶点结构域、表达、通路信息输出:靶点热度评分、数据稀缺性预警。
调用 ls_patent_search(target=[...], patent_core_type=["product_compound"]) 检索化合物专利数量。
对 Top-10 代表性专利依次调用:
ls_patent_structure_fetch(pn=...) — 获取专利关联化合物数ls_sar_submit(pn=...) → 轮询 ls_sar_fetch(task_id=...) — 提取 SAR 结构-活性对根据样本专利平均化合物数外推全库估算量。
对 Step 3 提取的代表性化合物 SMILES 批量调用:
ls_admet_predict(smiles=[...]) — 预测 AMES 阳性率、hERG 风险比例根据实测淘汰率推算 ADMET 净留存比例,修正最终有效数据量预测。
ls_paper_search(target=[...], limit=1) — 统计文献总量ls_translational_medicine_search(target=[...], limit=1) — 获取转化医学条目数基于数据源类型,套用 references/compliance_rules.md 规则模板,
生成每类数据源的学术 / 商业合规评级与风险等级。
读取 references/cost_benchmarks.md 中的工时基准参数,结合数据量预测,计算:
调用 Office 工作流(office plan_workspace → run_builder → finalize)生成 Word 报告,
包含:方案概述、数据来源体系、字段规范、质量控制、合规评估、成本估算表、MCP 调用路线图。
输入:
{
"targets": ["PD-L1", "4-1BB"],
"task_type": "multi-target",
"use_case": "academic",
"molecule_type": "small_molecule",
"output_language": "zh"
}
智慧芽 MCP 检索结果摘要:
| 检索维度 | 结果 |
|---|---|
| PD-L1 相关 Phase 2+ 药物 | 53 款 |
| 4-1BB 相关药物 | 245 款 |
| 双靶(PD-L1×4-1BB)药物 | 459 款 |
| 化合物专利池 | 2,025+ 件 |
| 相关文献 | 34,742 篇 |
代表性双靶药物:Acasunlimab、Opamtistomig、Sotiburafusp alfa、Cenopodlin、MAX-10181、ABSK-043
数据量估算:
| 来源 | 预估条目 |
|---|---|
| ChEMBL(PD-L1) | ~8,000 |
| ChEMBL(4-1BB) | ~2,000 |
| BindingDB | ~3,000 |
| 专利 SAR(智慧芽) | ~4,000 |
| PubChem HTS | ~2,000 |
| 负样本/ZINC | ~6,000 |
| 文献补充 | ~500 |
| 合计(ADMET 前) | ~25,500 |
| ADMET 净留存(约 65%) | ~16,575 |
成本估算(学术场景):
| 工项 | 工时(低-高) | 中位 |
|---|---|---|
| 数据采集(脚本化) | 3–5 人天 | 4 人天 |
| 数据清洗 & 去重 | 4–7 人天 | 5.5 人天 |
| ADMET 批量预测 | 0.5–1.5 人天 | 1 人天 |
| 专利 SAR 提取 | 3–6 人天 | 4.5 人天 |
| 报告撰写 | 1–2 人天 | 1.5 人天 |
| 合计 | 11.5–21.5 人天 | 16.5 人天 |
合规评级: 学术使用 ✅ 全绿;商业使用 ⚠️ 专利 SAR 化合物需侵权评估
输出文件: pdl1-4-1bb-dataset-scheme.docx(7 章 + 附录,~44 KB)
详见 assets/example_output_pdl1_4-1bb.md。
| 文件 | 描述 |
|---|---|
{task_slug}-dataset-scheme.docx | 完整数据集构建方案 Word 报告(7 章 + 附录) |
{task_slug}-cost-summary.json | 结构化成本估算 JSON,可接入项目管理工具 |
{task_slug}-compliance-matrix.csv | 各数据源合规评级矩阵 |
{task_slug}-data-inventory.csv | 预估数据量清单(按来源分层) |
ls_sar_submit,大批量时建议分批(每批 ≤20 件),避免任务超时