Windows پر WSL2 کے ذریعے NGS ڈیٹا اینالیسس: ایک عملی ورک فلو

زبان: Read the English
version

دائرۂ کار: یہ مضمون تعلیمی اور تحقیقی مقاصد کے لیے ہے۔
یہ کسی تصدیق شدہ کلینیکل بایوانفارمیٹکس پائپ لائن کا متبادل نہیں۔
آخری سائنسی جائزہ: 29 ستمبر 2026۔

Windows
پر WSL2 کے ذریعے NGS ڈیٹا اینالیسس: ایک عملی ورک فلو

بایوانفارمیٹکس کے بہت سے معروف ٹولز بنیادی طور پر Linux کے لیے بنائے
گئے ہیں۔ Windows Subsystem for Linux 2، یعنی WSL2، Windows کے اندر Linux
ماحول فراہم کرتا ہے۔ اس طرح طالب علم اور محقق الگ کمپیوٹر یا dual boot
کے بغیر NGS کمانڈز سیکھ سکتے ہیں، چھوٹے ڈیٹا سیٹس پر تجربہ کر سکتے ہیں،
اور تحقیقی ورک فلو تیار کر سکتے ہیں۔

لیکن WSL2 عام لیپ ٹاپ کو high-performance computing cluster میں تبدیل
نہیں کرتا۔ مکمل genome ڈیٹا کے لیے بہت زیادہ RAM، storage اور وقت درکار
ہو سکتا ہے۔ اس رہنما کا مقصد ایک قابلِ اعتماد ابتدائی ماحول اور ایک
چھوٹا، قابلِ تصدیق FASTQ quality-control ورک فلو بنانا ہے۔

مختصر جواب: موجودہ WSL2 کو
wsl --install سے نصب کریں، فعال FASTQ اور BAM فائلیں
/mnt/c کے بجائے Linux filesystem میں رکھیں، Bioconda کا
strict environment بنائیں، اور integrity checks کے بعد FastQC/MultiQC سے
آغاز کریں۔ بڑے، مسلسل چلنے والے، shared یا clinical workloads کے لیے
governed server، HPC یا cloud environment استعمال کریں۔

اس رہنما میں کیا بنے گا؟

  • Ubuntu کے ساتھ WSL2؛
  • Linux فائل سسٹم میں الگ NGS پروجیکٹ؛
  • FastQC، MultiQC، Samtools اور BCFtools پر مشتمل قابلِ تکرار
    ماحول؛
  • FASTQ فائلوں کی جانچ اور QC رپورٹس کا عملی طریقہ؛
  • یہ فیصلہ کرنے کی فہرست کہ کب WSL2 کافی ہے اور کب server، HPC یا
    cloud درکار ہے۔

1۔ پہلے hardware اور
خالی storage دیکھیں

چھوٹے تربیتی ڈیٹا سیٹ کے لیے 8 GB RAM چل سکتی ہے، جبکہ 16 GB یا زیادہ
بہتر ہے۔ حقیقی exome یا genome پروجیکٹس اس سے کہیں زیادہ وسائل مانگ سکتے
ہیں۔ اگر workflow uncompressed intermediates، alignment files، indexes
اور temporary files بنائے گا تو compressed input کے مقابلے میں کم از کم
دو سے تین گنا خالی جگہ رکھنا ایک مفید ابتدائی اندازہ ہے۔ اصل ضرورت ٹول
اور ڈیٹا کے مطابق بدلتی ہے۔

PowerShell میں WSL ورژن دیکھیں:

wsl --status
wsl --version
wsl --list --verbose

اگر Ubuntu کے سامنے version 1 لکھا ہو تو Administrator PowerShell
میں:

wsl --set-version Ubuntu 2

2۔ WSL2 نصب یا اپ ڈیٹ کریں

سپورٹڈ Windows 10 اور Windows 11 پر Administrator PowerShell کھولیں
اور چلائیں:

wsl --install

Restart کے بعد Ubuntu کھولیں اور Linux username/password بنائیں۔ پھر
PowerShell میں:

wsl --update

Ubuntu کے اندر:

sudo apt update
sudo apt upgrade -y
sudo apt install -y build-essential curl wget git unzip pigz

3۔ NGS فائلیں Linux فائل
سسٹم میں رکھیں

یہ WSL performance کا سب سے اہم فیصلہ ہے۔ Microsoft کی رہنمائی کے
مطابق Linux command-line tools کے لیے فائلیں WSL فائل سسٹم میں رکھنا
عموماً تیز ہوتا ہے۔ یعنی /home/username/ngs-project استعمال
کریں، نہ کہ /mnt/c/Users/...، خاص طور پر جب بڑی FASTQ، BAM
یا index فائلیں بار بار پڑھی جائیں۔

mkdir -p ~/ngs-project/{raw_data,qc,results,logs,envs}
cd ~/ngs-project

موجودہ Linux فولڈر کو Windows Explorer میں کھولنے کے لیے:

explorer.exe .

اہم raw data کی محفوظ backup copy الگ رکھیں۔ WSL working storage ہے،
backup policy نہیں۔

4۔ قابلِ تکرار tool
environment بنائیں

Official Miniforge installer کے ذریعے Conda-compatible ماحول نصب
کریں، نیا shell کھولیں، اور Bioconda channels کو موجودہ دستاویزی ترتیب
میں شامل کریں۔ موجودہ Bioconda رہنمائی میں defaults channel
شامل نہیں ہے:

conda config --add channels bioconda
conda config --add channels conda-forge
conda config --set channel_priority strict

اب ماحول بنائیں:

conda create -n ngs-qc -y fastqc multiqc samtools bcftools seqkit
conda activate ngs-qc

ورژن محفوظ کریں:

fastqc --version
multiqc --version
samtools --version | head -n 2
bcftools --version | head -n 2
conda env export --from-history > envs/ngs-qc.yml
conda list --explicit > envs/ngs-qc-explicit.txt

5۔ FASTQ فائلیں تجزیے سے
پہلے جانچیں

ابتدا کسی چھوٹے public training dataset سے کریں، clinical یا ناقابلِ
واپسی نمونے سے نہیں۔

cd ~/ngs-project
ls -lh raw_data
gzip -t raw_data/*.fastq.gz
zcat raw_data/sample_R1.fastq.gz | head -n 8

gzip -t compressed فائل کی integrity دیکھتا ہے۔ FASTQ
record چار لائنوں پر مشتمل ہوتا ہے: @ سے شروع ہونے والا
identifier، sequence، + لائن، اور base-quality characters۔
دو records دیکھنا واضح غلطی پکڑ سکتا ہے، مگر یہ مکمل QC کا متبادل
نہیں۔

Paired-end data میں دونوں mates اور read counts دیکھیں:

seqkit stats raw_data/*.fastq.gz

6۔ FastQC اور MultiQC چلائیں

mkdir -p qc/fastqc
fastqc --threads 4 --outdir qc/fastqc raw_data/*.fastq.gz \
  2>&1 | tee logs/fastqc.log

multiqc qc/fastqc --outdir qc/multiqc \
  2>&1 | tee logs/multiqc.log

رپورٹ کھولیں:

explorer.exe qc/multiqc/multiqc_report.html

Per-base quality، adapter content، duplication، overrepresented
sequences، GC distribution اور read lengths دیکھیں۔ ہر warning ناکام
experiment نہیں ہوتی۔ Amplicon اور RNA-seq libraries میں کچھ biases
متوقع ہو سکتے ہیں، اس لیے library design اور downstream analysis کے
تناظر میں نتیجہ سمجھیں۔

7۔ Checksums اور manifest
محفوظ کریں

sha256sum raw_data/*.fastq.gz > raw_data/SHA256SUMS
sha256sum -c raw_data/SHA256SUMS

Sample ID، read files، library type، reference build اور source کے
ساتھ مختصر manifest بنائیں۔ فائل ناموں میں مریض کا نام یا دوسری شناختی
معلومات نہ رکھیں۔ حساس انسانی genomic data کے لیے ادارے کی encryption،
access، retention اور audit پالیسی پر عمل کریں؛ ذاتی WSL installation
لازماً ان تقاضوں کو پورا نہیں کرتا۔

8۔ WSL2
resources صرف ضرورت کے مطابق محدود کریں

Windows میں %UserProfile%\.wslconfig مثال:

[wsl2]
memory=12GB
processors=6
swap=8GB

پھر PowerShell میں:

wsl --shutdown

ان values کو سوچے بغیر copy نہ کریں۔ Windows کے لیے مناسب CPU اور
memory چھوڑیں اور اپنے workload کی نگرانی کریں۔

9۔ WSL2 کی حدود سمجھیں

WSL2 سیکھنے، scripts تیار کرنے، چھوٹے یا درمیانے ڈیٹا پر QC، اور
workflow testing کے لیے مفید ہے۔ درج ذیل حالات میں Linux server، HPC
cluster یا governed cloud بہتر ہو سکتا ہے:

  • بڑے cohorts یا whole-genome processing؛
  • ایسے طویل jobs جو laptop restart سے متاثر نہ ہوں؛
  • حساس انسانی genomic data؛
  • validated clinical pipeline؛
  • shared infrastructure، scheduler یا team audit trail۔

GATK کی platform guidance Linux اور دوسرے POSIX-compatible systems کو
ہدف بناتی ہے اور native Windows کو support نہیں کرتی۔ WSL2 Linux ماحول
دیتا ہے، مگر اہم workflow کے لیے ہر tool کی اپنی support documentation
دیکھیں اور known dataset سے output validate کریں۔ صرف کامیاب
installation analytical correctness ثابت نہیں کرتی۔

عام مسائل

Analysis بہت سست ہے

دیکھیں کہ فائلیں /mnt/c میں تو نہیں۔ Working data کو
~/ngs-project میں منتقل کریں۔ df -h سے storage
اور free -h سے memory دیکھیں۔

Ubuntu دوبارہ کھولنے
پر command نہیں ملتی

conda activate ngs-qc

Paired files کے read
counts مختلف ہیں

Alignment سے پہلے رک جائیں۔ Naming، download completeness، trimming
history اور orphan-read handling چیک کریں۔

Reproducibility checklist

  • Windows، WSL اور Ubuntu versions؛
  • tool versions اور exported environment؛
  • input checksums؛
  • reference genome build اور reference-file checksums؛
  • commands، parameters، timestamps اور logs؛
  • public reference dataset پر متوقع outputs۔

اگلا منطقی قدم FASTQ quality scores سمجھنا، پھر alignment،
SAM/BAM/CRAM اور variant formats سیکھنا ہے۔ اگر کسی معلوم genomic
position کے گرد چھوٹا validation amplicon design کرنا ہو تو Sci Chores
کا Pronto
Primer
مدد دے سکتا ہے؛ یہ NGS computational pipeline کا حصہ
نہیں۔

ماخذ اور مزید مطالعہ

Don’t miss out on Science!

We don’t spam! Read our privacy policy for more info.

Leave a Comment

Your email address will not be published. Required fields are marked *

This site uses Akismet to reduce spam. Learn how your comment data is processed.

Scroll to Top