PRIMERCAT · 方法学说明

计算方法、参数与适用范围

摘要

本文档说明 PrimerCat 如何选择参考序列、生成候选、执行数据库筛查并形成排序。所有阈值均对应当前实现;计算评分只用于候选间比较,不表示实验成功概率。

文档版本 1.3更新:2026-09-04适用:PrimerCat Web
01

输入与参考序列

模板选择决定后续所有坐标、候选和筛查结论,因此 PrimerCat 把所用 accession 与选择理由作为结果的一部分。

基因名称模式

PrimerCat 当前支持人和小鼠。PrimerCat 在 NCBI Nucleotide 中检索 RefSeq mRNA,优先选择检索记录中的 MANE Select;若无 MANE Select,则在 NM_ 编码转录本中选择 CDS 最长者。设计窗口为 CDS 上下游各延伸 200 bp,并限制在 3,000 bp 内。1,2

该规则只作用于本次实际取回的记录(最多检索 10 个 ID、读取前 5 条 GenBank 记录),不是对该基因全部异构体的穷尽比较。小鼠记录通常没有 MANE Select,因此更多依赖 CDS 长度回退规则。

自定义序列模式

输入序列经过去空白、转大写与字符检查。qPCR/PCR 允许 A、C、G、T、N;N 比例超过 10% 时拒绝设计。CRISPR 直接在提供的 DNA 序列上扫描,不推断其物种、基因组版本或基因座。

02

qPCR 引物设计

qPCR 流程由模板解析、Primer3 候选生成、可用后端筛查和五维启发式排序组成。3,4

计算流程

01

候选生成

Primer3 最多生成 30 对候选,并按 Primer3 pair penalty 由低到高预排序。

02

候选缩减

仅筛查排序靠前的 max(2 × 请求返回数, 10) 对;因此后续排名针对该子集,不代表所有可能引物对。

03

成对扩增筛查

生产环境的人类与小鼠模式同时查询版本固定的本地基因组和配套 RefSeq RNA;若本地基因组不可用,才回退到按物种过滤的 NCBI RefSeq RNA BLAST。

04

分项状态与排序

结果分别呈现序列参数、特异性证据和跨外显子状态。详情中的排序分沿用已冻结基准记录的五项启发式规则;筛查失败时特异性项记 0,不把未知当作通过。

默认设计约束

参数当前值方法学含义
引物长度18–25 nt;最优 20 nt用于 Primer3 候选生成
Tm58–62 °C;最优 60 °C单条引物目标范围
GC40–60%单条引物目标范围
扩增子80–200 bpRT-qPCR 默认区间
同聚核苷酸最多 4 ntPRIMER_MAX_POLY_X
结构阈值self-any 45 °C;self-end 35 °C;hairpin 24 °CPrimer3 热力学上限;引物对互补上限同为 45/35 °C

三个筛查范围不可等同

后端搜索范围当前判定不能推出
本地基因组 Bowtie2GRCh38.p14 或 GRCm39端到端;保留覆盖 ≥85%、≤2 个错配的命中;每端最多 64 个判定命中,再按方向、距离和目标基因座组成 50–5,000 bp 产物。可发现外显子外命中,但结论仍受组装版本、阈值和命中上限限制。
本地 RefSeq RNA Bowtie2与组装注释发布配套的 accessioned RNA每端最多 128 个判定命中;分别统计所选转录本、同基因异构体、其他基因和未分类转录本产物。只覆盖该固定注释中的转录本,不代表样本实际表达谱或未注释转录本。
NCBI RefSeq RNA BLAST 回退物种过滤的参考转录本仅在本地基因组不可用时使用;短序列 BLAST,每条引物最多 5 个 hits,统计覆盖 ≥85% 的 HSP。是受返回集限制的转录本初筛,不能证明全基因组唯一。

生产参考固定为人类 GRCh38.p14(GCF_000001405.40,RefSeq 2025-08 注释)和小鼠 GRCm39(GCF_000001635.27,RefSeq 2024-02 注释)。13,14,15,16 查看当前生产证据快照 →

03

常规 PCR 引物设计

常规 PCR 使用研究者提供的单条 DNA 模板。预设只改变参数起点;研究者实际提交的参数才是本次计算依据。3

设计

Primer3 使用 18–25 nt、GC 40–60%、最多 4 个连续相同碱基及与 qPCR 相同的热力学结构上限。标准、菌落 PCR、高保真预设的默认产物区间分别为 150–800、200–1,500、500–3,000 bp。

目标区间

若研究者给出 1-based 闭区间,PrimerCat 要求返回的扩增子完整包含该区域;结果同时报告引物与扩增子的模板坐标。

退火建议

PrimerCat 显示的值是简单起始估计:较低引物 Tm − 3 °C;建议梯度为较低 Tm − 5 至 −1 °C。它不是针对具体聚合酶/缓冲液拟合的热循环条件。

可选特异性筛查

PrimerCat 分别在 NCBI nt 中检索两条引物对物种过滤 RefSeq genomic 记录的命中,再配对同一 accession 上方向相反、间距合规的记录。

配对筛查判定

  • 单条引物查询覆盖率 ≥85%
  • 总错配 ≤3
  • 引物 3′ 端最后 3 nt 必须完全匹配
  • 默认扩增子范围 50–5,000 bp
  • 每条引物最多检索 100 个 hits;页面最多展示 10 个配对记录

“找到 1 个配对记录”只描述本次 BLAST 返回集。结果达到 hit 上限时会标记可能截断;该流程不是 in-silico PCR 的全基因组穷举,也不检查常见变异位点。4,6

04

CRISPR gRNA 设计

PrimerCat 先在正链与反向互补链扫描 PAM,再将序列特征分数与脱靶筛查结果分开计算,最后优先按脱靶标签、其次按活性启发分排序。7,8

核酸酶PAM候选结构实现说明
SpCas9NGG(3′)20 nt + PAM双链扫描
SpCas9-NGNG(3′)20 nt + PAM放宽 PAM,不代表与野生型具有相同活性
Cas12aTTTV(5′)PAM + 20 ntV = A/C/G

活性分数

SpCas9/SpCas9-NG 分数受 Doench Rule Set 2 启发,但当前代码只使用缩减后的位点碱基权重、GC 区间、poly-T/poly-G、种子区同聚序列与末端偏好;Cas12a 使用另一套简化规则。它不是原论文模型的完整复现,也未考虑染色质可及性、细胞类型、递送方式或表达系统。7

PAM 依据

SpCas9-NG 的 NG 识别与 Cas12a 的 T-rich PAM 来自相应核酸酶研究;不同变体、细胞与靶点的实测活性仍可能显著不同。9,10

脱靶筛查

后端范围当前实现
本地 Bowtie2参考基因组20 nt 端到端比对、默认 ≤3 错配、最多 32 个比对;随后检查候选位点是否具有对应的规范 PAM。可选目标坐标用于锚定 on-target。
NCBI nt BLAST 回退物种过滤的 nt短查询、最多 15 个 hits;过滤有 gap、长度不足与 >4 错配的 HSP。若未提供可用基因座,最强命中被启发式视为 on-target。

Bowtie2/BLAST 的相似序列筛查不能预测真实切割,也不覆盖 bulge、结构变异、样本特异变异和细胞状态。低风险标签是候选优先级,不是生物安全结论。8

05

BLAST 序列比对

BLAST 页面将查询提交给 NCBI,支持 blastn、blastp、blastx、tblastn 与 nt、nr、RefSeq RNA、RefSeq protein、Swiss-Prot 数据库的兼容组合。6

PrimerCat 将研究者选择的 E-value 阈值和 hit 数量(1–50)随请求提交。对于每个数据库 hit,PrimerCat 仅展示 bit score 最高的 HSP,并报告 E-value、raw/bit score、identity、gap、坐标和 accession;页面中的序列片段限制为 300 个字符。BLAST 是局部相似性检索,研究者不能仅凭结果断言同源关系、功能注释、系统发育关系或统计多重检验结论。

06

实验室参考资料的方法边界

我们把溶液、Protocol 与试剂安全定位为人工整理的参考资料;其证据性质不同于实时计算或数据库检索。

模块页面提供使用边界
溶液配制按摩尔浓度、稀释倍数或百分浓度执行确定性换算;常用配方按目标终体积线性缩放。配方中的 pH、温度、纯度、水合物和加样顺序仍以原始来源与实验室 SOP 为准。
Protocol把常见工作流整理为适用范围、材料、步骤、质控点和安全提示。属于研究参考,不是经过本站实验验证的标准操作规程。
化学品安全静态条目汇总代表性 PubChem LCSS/GHS 信息并链接来源。不是实时法规数据库;纯物质、浓度、混合物和供应商会改变分类,实际操作以瓶身和当前 SDS 为准。

PubChem 汇集多来源化学信息;页面采用代表性记录,不把聚合数据误写成单一、永久有效的法规结论。12

REF

参考文献

文献用于说明算法、数据库与实验验证框架。引用某篇论文不表示 PrimerCat 完整复现其全部模型。

  1. [1]

    Morales J, et al. (2022). “A joint NCBI and EMBL-EBI transcript set for clinical genomics and research” Nature. 604:310–315. doi:10.1038/s41586-022-04558-8 ↗

  2. [2]

    O’Leary NA, et al. (2016). “Reference sequence (RefSeq) database at NCBI: current status, taxonomic expansion, and functional annotation” Nucleic Acids Research. 44:D733–D745. doi:10.1093/nar/gkv1189 ↗

  3. [3]

    Untergasser A, et al. (2012). “Primer3—new capabilities and interfaces” Nucleic Acids Research. 40:e115. doi:10.1093/nar/gks596 ↗

  4. [4]

    Ye J, et al. (2012). “Primer-BLAST: a tool to design target-specific primers for polymerase chain reaction” BMC Bioinformatics. 13:134. doi:10.1186/1471-2105-13-134 ↗

  5. [5]

    Langmead B, Salzberg SL. (2012). “Fast gapped-read alignment with Bowtie 2” Nature Methods. 9:357–359. doi:10.1038/nmeth.1923 ↗

  6. [6]

    Camacho C, et al. (2009). “BLAST+: architecture and applications” BMC Bioinformatics. 10:421. doi:10.1186/1471-2105-10-421 ↗

  7. [7]

    Doench JG, et al. (2016). “Optimized sgRNA design to maximize activity and minimize off-target effects of CRISPR-Cas9” Nature Biotechnology. 34:184–191. doi:10.1038/nbt.3437 ↗

  8. [8]

    Hsu PD, et al. (2013). “DNA targeting specificity of RNA-guided Cas9 nucleases” Nature Biotechnology. 31:827–832. doi:10.1038/nbt.2647 ↗

  9. [9]

    Nishimasu H, et al. (2018). “Engineered CRISPR-Cas9 nuclease with expanded targeting space” Science. 361:1259–1262. doi:10.1126/science.aas9129 ↗

  10. [10]

    Zetsche B, et al. (2015). “Cpf1 is a single RNA-guided endonuclease of a class 2 CRISPR-Cas system” Cell. 163:759–771. doi:10.1016/j.cell.2015.09.038 ↗

  11. [11]

    Bustin SA, et al. (2025). “MIQE 2.0: Revision of the Minimum Information for Publication of Quantitative Real-Time PCR Experiments Guidelines” Clinical Chemistry. 71:634–651. doi:10.1093/clinchem/hvaf043 ↗

  12. [12]

    Kim S, et al. (2025). “PubChem 2025 update” Nucleic Acids Research. 53:D1516–D1525. doi:10.1093/nar/gkae1059 ↗

  13. [13]

    NCBI RefSeq (2025). “Homo sapiens genome assembly GRCh38.p14” NCBI Datasets. RefSeq assembly GCF_000001405.40. Source ↗

  14. [14]

    NCBI RefSeq (2025). “Homo sapiens Annotation Release GCF_000001405.40-RS_2025_08” NCBI Eukaryotic Genome Annotation. GRCh38.p14 RefSeq annotation report. Source ↗

  15. [15]

    NCBI RefSeq (2024). “Mus musculus genome assembly GRCm39” NCBI Datasets. RefSeq assembly GCF_000001635.27. Source ↗

  16. [16]

    NCBI RefSeq (2024). “Mus musculus Annotation Release GCF_000001635.27-RS_2024_02” NCBI Eukaryotic Genome Annotation. GRCm39 RefSeq annotation report. Source ↗

复现清单

将方法说明与结果记录一起保存

研究者若要复现一次设计,至少应记录输入序列或 accession、物种、参数、筛查后端、数据库范围、运行日期与候选序列。