زبان: English version پڑھیں
دائرۂ کار: یہ مضمون تعلیمی اور تحقیقی استعمال کے لیے ہے۔ Quality score اکیلا clinical نتیجے کی توثیق نہیں کرتا۔
آخری سائنسی جائزہ: 2 اکتوبر 2026۔
FASTQ اور Phred Quality Scores: NGS کوالٹی کنٹرول کا عملی رہنما
FASTQ فائل ہر sequencing read کے لیے دو بنیادی چیزیں محفوظ کرتی ہے: nucleotide sequence اور ہر base کے لیے quality character۔ یہ characters اس بات کا اندازہ دیتے ہیں کہ base call کتنا قابلِ اعتماد ہے۔ انہیں درست سمجھنے سے alignment، trimming یا مزید تحقیق کے فیصلے بہتر ہوتے ہیں۔
یہ رہنما FASTQ specification اور موجودہ Illumina documentation کی بنیاد پر ہے۔ اسے Sci Chores کے WSL2 NGS workflow کے ساتھ استعمال کیا جا سکتا ہے، لیکن یہ validated laboratory یا clinical pipeline کا متبادل نہیں۔
FASTQ record میں کیا ہوتا ہے؟
عام FASTQ record چار لائنوں پر مشتمل ہوتا ہے:
@سے شروع ہونے والا identifier۔- Nucleotide sequence۔
+separator line، جو کبھی identifier دوبارہ بھی دکھاتی ہے۔- Quality string، جس میں ہر nucleotide کے لیے ایک character ہوتا ہے۔
Sequence اور quality string کی length برابر ہونی چاہیے۔ فرق file corruption، غلط conversion یا parsing error کی علامت ہو سکتا ہے، اس لیے analysis سے پہلے اسے درست کریں۔
Phred quality score کیسے کام کرتا ہے؟
Phred score کا formula Q = -10 log10(P) ہے، جہاں P base call کے غلط ہونے کا estimated probability ہے۔
- Q10: تقریباً 1 میں 10 error probability، یعنی 90% expected accuracy۔
- Q20: تقریباً 1 میں 100 error probability، یعنی 99% expected accuracy۔
- Q30: تقریباً 1 میں 1,000 error probability، یعنی 99.9% expected accuracy۔
یہ per-base اندازے ہیں، ہر read یا ہر variant کی guarantee نہیں۔ Chemistry، cycle، library preparation، platform اور downstream evidence بھی اہم ہیں۔
Quality string symbols کی شکل میں کیوں ہوتی ہے؟
FASTQ quality values کو ASCII characters کی صورت میں محفوظ کرتا ہے۔ عام Phred+33 encoding میں quality value، character کے ASCII code میں سے 33 نکال کر ملتی ہے۔ مثال کے طور پر !، Q0 کو ظاہر کرتا ہے۔ Phred+64 کو صرف اسی وقت فرض کریں جب instrument یا file documentation واضح طور پر ایسا کہے۔
کچھ جدید workflows quality-score binning استعمال کرتے ہیں۔ Binning quality values کی تعداد کم کرتی ہے، مگر اکثر analyses کے لیے مفید information برقرار رہتی ہے۔ Run manifest میں platform اور conversion settings ضرور لکھیں۔
Alignment سے پہلے کیا جانچیں؟
- File integrity: compressed file کے لیے
gzip -t sample.fastq.gzچلائیں اور transfer کے بعد checksums verify کریں۔ - Record structure: ہر record کی چار لائنیں اور sequence/quality کی برابر length دیکھیں۔
- Paired reads: R1 اور R2 موجود ہوں، names compatible ہوں اور read counts match کریں۔
- Per-base quality: دیکھیں کہ read کے آخر میں quality تیزی سے کم تو نہیں ہوتی۔
- Adapters: adapter contamination اور غیر متوقع sequences کی تحقیق کریں۔
- GC اور duplication: assay کے تناظر میں سمجھیں؛ amplicon، RNA-seq، targeted panel اور whole-genome libraries کے profiles مختلف ہوتے ہیں۔
FastQC اور MultiQC سے بنیادی check
FastQC اور MultiQC نصب ہوں تو یہ مختصر check چلائیں:
mkdir -p qc/fastqc qc/multiqc logs
gzip -t raw_data/*.fastq.gz
fastqc --threads 4 --outdir qc/fastqc raw_data/*.fastq.gz 2>&1 | tee logs/fastqc.log
multiqc qc/fastqc --outdir qc/multiqc 2>&1 | tee logs/multiqc.log
Tool versions، commands، checksums، reference build اور QC reports project کے ساتھ محفوظ رکھیں۔ FastQC کا red یا amber module خود بخود پورا dataset discard کرنے کی وجہ نہیں؛ پہلے library design اور assay context دیکھیں۔
Quality score، coverage اور mapping quality ایک چیز نہیں
Base quality ایک base call کے confidence کو ظاہر کرتا ہے۔ Coverage بتاتی ہے کہ کسی location پر کتنی reads موجود ہیں۔ Mapping quality بتاتی ہے کہ read صحیح جگہ align ہونے کا confidence کیا ہے۔ Variant review میں ان signals کے ساتھ strand balance، allele fraction، local sequence context، platform artefacts اور مناسب reference بھی دیکھیں۔ صرف high average Q score poor alignment یا contamination کو درست نہیں کر سکتا۔
کیا ہر low-quality base کو trim کرنا چاہیے؟
ہر assay کے لیے Q20 یا Q30 trimming کا ایک universal rule نہیں۔ Trimming مفید sequence کم کر سکتی ہے اور read-length distribution بدل سکتی ہے۔ Pre- اور post-trimming reports کا تقابل کریں، library اور downstream tool کے مطابق parameters منتخب کریں، اور command/version محفوظ کریں۔
عام غلطیاں
- ASCII encoding سمجھے بغیر چوتھی لائن کو numeric score سمجھنا۔
- Phred+33 file پر Phred+64 فرض کرنا۔
- صرف average score دیکھ کر dataset کو “good” کہنا۔
- Q score کو depth، mapping quality یا variant quality کے برابر سمجھنا۔
- حساس clinical samples کو unmanaged personal computer پر چلانا۔
عملی checklist
- Sequencer، run software، conversion settings اور quality encoding لکھیں۔
- Checksums اور paired-read counts verify کریں۔
- FastQC چلائیں اور MultiQC سے summary بنائیں۔
- Adapters، quality decay، GC bias، duplication اور overrepresented sequences کو assay کے تناظر میں سمجھیں۔
- Trimming یا filtering document کریں اور before/after reports محفوظ رکھیں۔
- Original FASTQ کو تبدیل نہ کریں؛ traceable copy پر کام کریں۔
