NGS 数据分析入门:从 FASTQ 到变异检出
高通量测序(NGS)已经是分子生物学实验室的标配了。但从拿到测序数据到生成可用的分析结果,中间涉及多个处理步骤。本文整理了一个标准分析流程,适合刚开始接触 NGS 数据处理的同学。
第一步:理解 FASTQ 格式
测序仪下机的原始数据通常是 FASTQ 格式。一个 FASTQ 文件由四行一组构成:第一行是序列 ID(以 @ 开头),第二行是碱基序列,第三行是分隔符(+),第四行是质量分数(Phred score,编码为 ASCII 字符)。
拿到数据后第一件事是跑 FastQC,它会生成一份 HTML 报告,告诉你每碱基质量、GC 含量、接头污染情况等。这是判断数据好坏最重要的一步,不要跳过。
fastqc sample_R1.fastq.gz sample_R2.fastq.gz -o qc_reports/
第二步:接头去除与质控过滤
FastQC 报告通常会显示接头污染和低质量碱基的问题。使用 Trimmomatic 或 fastp 进行处理。我个人偏好 fastp,因为它快、输出的 JSON 报告方便后续做统计。
fastp -i sample_R1.fastq.gz -I sample_R2.fastq.gz \
-o clean_R1.fastq.gz -O clean_R2.fastq.gz \
--detect_adapter_for_pe -j fastp_report.json
第三步:参考基因组比对
将质控后的 reads 比对到参考基因组上。BWA 是最常用的比对工具,生成 SAM 格式的比对结果。然后用 samtools 转换为 BAM 并排序。人类基因组参考通常用 hg19(GRCh37)或 hg38(GRCh38),选择哪个取决于你的分析目的。
bwa mem -t 8 -R "@RG\tID:sample\tSM:sample" ref.fa \
clean_R1.fastq.gz clean_R2.fastq.gz | \
samtools sort -o sample.sorted.bam -
第四步:去重与重校准
PCR 扩增会引入重复 reads,导致变异等位基因频率计算偏差。用 Picard 或 samtools 的 markdup 功能标记(或移除)重复。GATK 的 BaseRecalibrator 可以对碱基质量分数进行经验性校正。
第五步:变异检出
根据不同应用场景选择不同工具:胚系变异用 GATK HaplotypeCaller 或 DeepVariant;体细胞变异用 Mutect2 或 VarScan2。检出后生成 VCF 文件,包含每个位点的基因型、等位基因频率和质量信息。
第六步:变异注释
VCF 文件里的变异信息很原始,需要用 Annovar 或 VEP(Variant Effect Predictor)进行注释,包括:该变异在哪个基因上、是否导致氨基酸改变、在人群数据库(gnomAD/1000G)中的频率、ClinVar 中的致病性分类等。
小结
NGS 分析是一个多步骤的管道工作,每一步都有多种工具可选。建议初学的时候先完整走一遍标准流程,理解每个步骤的目的和输出,再根据具体项目调整参数。别一上来就调参,先跑通再优化。
← 返回首页