Bcftools؛ از نصب تا Variant Calling و تحلیل واریانت

Bcftools یکی از قدرتمندترین ابزارهای متن‌باز برای فراخوانی، فیلتر، پردازش و مدیریت فایل‌های VCF و BCF در پروژه‌های توالی‌یابی نسل جدید (NGS) است. این نرم‌افزار که بخشی از اکوسیستم SAMtools/HTSlib محسوب می‌شود، با سرعت بالا، انعطاف‌پذیری و عملکرد قابل‌اعتماد، به یکی از ابزارهای استاندارد در پایپلاین‌های بیوانفورماتیک تبدیل شده است. در این مقاله با قابلیت‌ها، نحوه نصب، ساختار دستورات و نکات کاربردی کار با Bcftools آشنا می‌شوید تا بتوانید از آن به‌صورت اصولی در تحلیل داده‌های ژنومی استفاده کنید. برای یادگیری کامل این ابزار، ادامه مقاله را از دست ندهید.
محتوای آموزک BCFtools

فهرست مطالب این نوشتار

جایگاه Bcftools در دنیای بیوانفورماتیک

برنامه Bcftools یک مجموعه ابزار جامع و خط فرمانی است که به‌طور اختصاصی برای فراخوانی واریانت‌ها (Variant Calling) و پردازش و دستکاری داده‌های تنوع ژنتیکی طراحی شده است. در عصر توالی‌یابی نسل جدید (NGS) که محققان با حجم عظیمی از دیتا روبه‌رو هستند، تسلط بر چنین برنامه‌ای برای مدیریت، فیلتر کردن و استخراج اطلاعات حیاتی از ژنوم، به یک مهارت کاملاً ضروری برای هر متخصص بیوانفورماتیک تبدیل شده است.

تاریخچه و جایگاه در اکوسیستم بیوانفورماتیک

نسخه اولیه Bcftools با زبان C توسط Heng Li در موسسه Sanger نوشته شد. امروزه نگهداری و توسعه این ابزار قدرتمند بر عهده Petr Danecek و سایر اعضای تیم توسعه‌دهندگان SAMtools است و محققان بسیاری در سراسر جهان با ارائه کدهای اصلاحی و گزارش باگ‌ها به بهبود مستمر آن کمک می‌کنند.

برنامه Bcftools در کنار SAMtools و کتابخانه زیربنایی HTSlib، یک سه‌گانه اساسی و قدرتمند برای آنالیز داده‌های توالی‌یابی تشکیل می‌دهد. در حالی که ابزارهایی مانند SAMtools روی فایل‌های هم‌ترازی توالی‌ها (مانند فرمت‌های BAM و CRAM) تمرکز دارند، تخصص ویژه Bcftools استخراج، مقایسه و مدیریت واریانت‌های ژنتیکی است.

طراحی مبتنی بر جریان داده (Streaming)

یکی از ویژگی‌های کلیدی که کارایی Bcftools را در پروژه‌های بزرگ به حداکثر می‌رساند، طراحی هوشمندانه آن برای پردازش جریانی (Streaming) است. این نرم‌افزار می‌تواند داده‌ها را مستقیماً از ورودی استاندارد سیستم (stdin) دریافت کرده و پس از پردازش، آن‌ها را به خروجی استاندارد (stdout) ارسال کند.

این معماری به شما اجازه می‌دهد تا چندین دستور مختلف را با استفاده از پایپ (|) به‌صورت زنجیره‌وار به یکدیگر متصل کنید. این قابلیت بی‌نظیر نه‌تنها نیاز به ذخیره‌سازی فایل‌های موقت حجیم در هارد دیسک را از بین می‌برد، بلکه با پردازش در لحظه، سرعت اجرای پایپلاین‌های پیچیده ژنومیک را به طرز شگفت‌انگیزی افزایش می‌دهد.

دانلود، نصب و اجرای Bcftools

پیش از آنکه وارد دنیای جذاب آنالیز واریانت‌ها شویم، باید محیط کار خود را آماده کنیم. برنامه Bcftools در اصل برای سیستم‌عامل‌های مبتنی بر یونیکس مانند لینوکس و macOS طراحی شده و در این محیط‌ها به بهترین شکل کار می‌کند. با این حال، اگر کاربر ویندوز هستید اصلاً جای نگرانی نیست؛ شما می‌توانید با استفاده از WSL یا ابزارهایی مانند Cygwin به راحتی این برنامه را اجرا کنید.

پیش‌نیازهای سیستمی

برای نصب موفقیت‌آمیز این ابزار (به ویژه اگر قصد کامپایل از کد منبع را دارید)، سیستم شما به حداقل الزاماتی نیاز دارد:

  • یک کامپایلر زبان C مانند GCC یا Clang به همراه ابزار make.
  • کتابخانه HTSlib که زیربنای اصلی برنامه است (اکثر روش‌های نصب خودکار، این کتابخانه را نیز نصب می‌کنند).
  • کتابخانه‌های فشرده‌سازی zlib و bzip2 برای کار با فایل‌های فشرده ژنومی.

روش‌های سریع و آسان نصب BCFtools

بهترین و بی‌دردسرترین راه برای نصب Bcftools، استفاده از ابزارهای مدیریت بسته (Package Managers) است. بسته به سیستم‌عامل خود می‌توانید از یکی از دستورات زیر استفاده کنید:

۱. نصب با Conda (توصیه شده برای ویندوز و محیط‌های ایزوله): استفاده از bioconda یکی از ساده‌ترین راه‌هاست.

conda install -c bioconda bcftools

۲. نصب در لینوکس (توزیع‌های اوبونتو و دبیان):

sudo apt-get update
sudo apt-get install bcftools

نکته: در توزیع‌های Fedora/CentOS/RHEL می‌توانید از دستور sudo yum install bcftools استفاده کنید.

۳. نصب در مک (macOS):

brew install bcftools

۴. نصب حرفه‌ای از کد منبع (Source Code): اگر به جدیدترین نسخه نیاز دارید، می‌توانید سورس کد را مستقیماً از لینک زیر دریافت کنید:

و سپس کامپایل نمایید:

cd bcftools
make

آماده‌سازی محیط کار و نکات طلایی

پس از پایان نصب، با اجرای دستور bcftools --version در ترمینال، از نصب صحیح برنامه و نسخه آن اطمینان حاصل کنید.

نکته طلایی برای فعال‌سازی پلاگین‌ها: برنامه Bcftools افزونه‌ها (Plugins) بسیار قدرتمندی برای آنالیزهای پیشرفته دارد. بسیاری از کاربران پس از نصب، با خطای عدم شناسایی این پلاگین‌ها مواجه می‌شوند. برای حل این مشکل، حتماً باید مسیر پلاگین‌ها را از طریق یک متغیر محیطی (Environment Variable) به سیستم معرفی کنید:

export BCFTOOLS_PLUGINS=/path/to/bcftools/plugins

(توجه: مسیر دقیق را بر اساس محل نصب سیستم خود جایگزین کنید، مثلاً /usr/local/libexec/bcftools ).

سازماندهی پروژه‌ها: هنگام کار با داده‌های حجیم NGS، آشفتگی فایل‌ها می‌تواند دردسرساز شود. توصیه می‌شود پیش از شروع کار، یک ساختار پوشه‌بندی منظم برای پروژه‌های خود ایجاد کنید:

mkdir -p ~/ngs_project/{data,results,scripts,temp}

این کار به شما کمک می‌کند تا فایل‌های ورودی، نتایج، اسکریپت‌ها و فایل‌های موقت را به شکلی حرفه‌ای از هم تفکیک کنید.

دستورات پایه و ساختار کلی Bcftools

ساختار دستوری برنامه Bcftools از یک الگوی منظم و مشخص پیروی می‌کند که درک آن، کلید استفاده مؤثر از این ابزار است. فرمت کلی اجرای دستورات در خط فرمان به شکل زیر است:

 bcftools [COMMAND] [OPTIONS] [FILE]
  • COMMAND (عملگر): دستوراتی مانند view ، filter یا merge که نوع پردازش را مشخص می‌کنند.
  • OPTIONS (آپشن‌ها): تنظیماتی که رفتار دستور را تغییر می‌دهند (با - یا -- شروع می‌شوند).
  • FILE (فایل ورودی): فایل VCF یا BCF شما (اگر فایلی مشخص نشود، برنامه داده‌ها را از ورودی استاندارد می‌خواند).

عملگرهای (Commands) اساسی در Bcftools

برنامه دارای مجموعه‌ای از عملگرهای قدرتمند است. کاربردی‌ترین آن‌ها عبارتند از:

۱. دستور view

این دستور برای مشاهده فایل، استخراج زیرمجموعه‌ای از واریانت‌ها یا نمونه‌ها و همچنین تبدیل بین فرمت‌های VCF و BCF استفاده می‌شود. در پایپلاین‌های چندمرحله‌ای، استفاده از خروجی BCF غیرفشرده (-Ou) باعث افزایش سرعت پردازش می‌شود.

در مثال زیر، تنها دو نمونه sample1 و sample2 از فایل انتخاب شده و خروجی به صورت BCF غیرفشرده تولید می‌شود.

bcftools view -Ou -s sample1,sample2 file.vcf

۲. دستور فیلتر کردن (view -i یا filter):

برای انتخاب یا حذف واریانت‌ها بر اساس معیارهایی مانند کیفیت، عمق خوانش یا سایر فیلدهای موجود در فایل VCF می‌توان از آپشن‌های -i و -e یا دستور filter استفاده کرد.

در مثال زیر، تنها واریانت‌هایی حفظ می‌شوند که مقدار QUAL بیشتر از ۲۰ و مقدار DP بیشتر از ۱۰ باشد.

bcftools view -i 'QUAL>20 && DP>10' file.vcf

۳. دستور isec

این دستور برای مقایسه دو یا چند فایل VCF یا BCF و شناسایی واریانت‌های مشترک یا اختصاصی بین آن‌ها به کار می‌رود.

در مثال زیر، دو فایل از نظر SNPها و Indelها با یکدیگر مقایسه می‌شوند.

bcftools isec -c snps -c indels file1.vcf.gz file2.vcf.gz

۴. دستور annotate

این دستور برای افزودن، حذف یا ویرایش اطلاعات موجود در فایل‌های VCF و BCF استفاده می‌شود.

در مثال زیر، اگر یک واریانت شناسه (ID) نداشته باشد، شناسه‌ای جدید بر اساس کروموزوم، موقعیت، آلل مرجع و آلل جایگزین برای آن ایجاد می‌شود.

bcftools annotate --set-id +'%CHROM\_%POS\_%REF\_%FIRST_ALT' file.vcf

آپشن‌های پرکاربرد (Common Options)

بسیاری از دستورهای BCFtools از مجموعه‌ای از آپشن‌های مشترک استفاده می‌کنند که در ادامه مهم‌ترین آن‌ها معرفی شده‌اند:

۱. تعیین نوع خروجی (-O یا –output-type)

این آپشن قالب فایل خروجی را مشخص می‌کند.

  • v : فایل VCF متنی (بدون فشرده‌سازی)
  • z : فایل VCF فشرده‌شده با BGZF
  • b : فایل BCF فشرده
  • u : فایل BCF غیرفشرده

در پایپلاین‌هایی که چند دستور BCFtools به‌صورت متوالی اجرا می‌شوند، استفاده از -Ou باعث حذف تبدیل‌های غیرضروری بین VCF و BCF و کاهش عملیات فشرده‌سازی و استخراج مجدد می‌شود؛ در نتیجه سرعت اجرای پایپلاین افزایش می‌یابد.

۲. انتخاب نواحی ژنومی (-r و -R)

از این آپشن‌ها برای محدود کردن پردازش به نواحی مشخصی از ژنوم استفاده می‌شود.

در مثال زیر، تنها ناحیه مشخص‌شده روی کروموزوم X پردازش خواهد شد.

-r X:2928329

اگر فهرست نواحی در یک فایل ذخیره شده باشد، می‌توان از گزینه -R استفاده کرد.

-R regions.bed

نکته: گزینه‌های -r و -R را نمی‌توان هم‌زمان به کار برد.

۳. انتخاب نمونه‌ها (-s و -S)

این آپشن‌ها برای انتخاب یا حذف نمونه‌های موردنظر از فایل VCF یا BCF استفاده می‌شوند.

در مثال زیر، فقط دو نمونه sample1 و sample2 انتخاب می‌شوند.

-s sample1,sample2

اگر تعداد نمونه‌ها زیاد باشد، می‌توان نام آن‌ها را در یک فایل متنی (هر نمونه در یک خط) قرار داد و با گزینه -S فراخوانی کرد.

-S samples.txt

برای حذف نمونه‌های موجود در فایل نیز کافی است علامت ^ قبل از نام فایل قرار گیرد.

-S ^samples.txt

دستورهای معرفی‌شده در این بخش، هسته اصلی کار با BCFtools را تشکیل می‌دهند و در بسیاری از پایپلاین‌های تحلیل داده‌های واریانت به‌طور مداوم مورد استفاده قرار می‌گیرند.

فراخوانی واریانت‌ها با Bcftools

فراخوانی واریانت (variant calling) فرآیندی است که طی آن تفاوت‌های ژنتیکی (مانند SNPها و Indelها) از روی داده‌های توالی‌یابی استخراج می‌شوند. این فرآیند استاندارد نیازمند دو مرحله است که معمولاً در یک خط دستور با هم ترکیب می‌شوند: ابتدا استفاده از دستور mpileup برای خوانش هم‌ترازی‌ها و سپس استفاده از call برای استخراج واریانت‌ها.

دستور زیر، روش استاندارد استخراج سایت‌های واریانت از فایل‌های BAM را ارائه می‌دهد:

bcftools mpileup -Ou -f reference.fa alignments.bam | bcftools call -mv -Ob -o calls.bcf

کالبدشکافی دستور

بیایید بررسی کنیم که هر یک از این پارامترها دقیقاً چه کاری انجام می‌دهند:

بخش اول: bcftools mpileup این بخش وظیفه بررسی فایل‌های هم‌ترازی (alignments.bam) و مقایسه آن‌ها با ژنوم مرجع را دارد.

  • -f: مسیر فایل ژنوم مرجع را به برنامه می‌دهد.
  • -Ou: خروجی را به صورت BCF غیرفشرده تولید می‌کند. استفاده از این آپشن هنگام ارسال داده‌ها به دستور بعدی (call) باعث جلوگیری از اتلاف زمان برای فشرده‌سازی و خارج کردن از حالت فشرده می‌شود و سرعت کار را به شدت بالا می‌برد.

بخش دوم: bcftools call این دستور داده‌های خام پردازش‌شده توسط mpileup را می‌گیرد و تصمیم‌گیری نهایی را برای وجود یا عدم وجود واریانت انجام می‌دهد.

  • -m: این آپشن متد جدیدتر و پیش‌فرض برنامه برای فراخوانی واریانت‌هاست که عملکرد بسیار بهتری در شناسایی واریانت‌های چندآللی (Multiallelic) و واریانت‌های نادر دارد.
  • -v: به برنامه می‌گوید که سایت‌های مشابه با رفرنس را نادیده بگیرد و در فایل خروجی، فقط سایت‌هایی را که دارای واریانت (تغییر) هستند ذخیره کند.
  • -Ob: خروجی نهایی را به صورت فایل BCF فشرده تولید می‌کند که برای ذخیره‌سازی بهینه‌ترین حالت است.
  • -o: مسیر و نام فایل نهایی را مشخص می‌کند.

همان‌طور که مشاهده کردید، معماری هوشمندانه bcftools به شما اجازه می‌دهد تا با ترکیب این دو دستور، داده‌های خام هم‌ترازی را با بالاترین سرعت و دقت به فایل‌های واریانت تبدیل کنید. البته کار آنالیز در اینجا تمام نمی‌شود؛ چرا که گام بعدی و بسیار حیاتی در این پایپلاین، فیلتر کردن دقیق این واریانت‌های اولیه برای حذف خطاهای توالی‌یابی و رسیدن به نتایج قابل‌اطمینان است.

فیلتر کردن واریانت‌ها در Bcftools

فایل‌های واریانتِ خام (خروجی مرحله قبل) معمولاً حاوی تعداد زیادی خطای توالی‌یابی یا اصطلاحاً «مثبت کاذب» (False Positives) هستند. دستور filter ابزار تخصصی شما برای ارزیابی کیفی این سایت‌ها و اعمال فیلترهای دقیق با استفاده از عبارات ریاضی و منطقی (Expressions) است.

فیلتر نرم (Soft Filtering) در مقابل فیلتر سخت

یکی از قابلیت‌های کلیدی و بسیار مهمِ دستور filter، امکان انجام “فیلتر نرم” است. در این روش، واریانت‌های بی‌کیفیت یا نامطمئن از فایل شما حذف فیزیکی نمی‌شوند؛ بلکه برنامه ستون FILTER را در فایل VCF برای آن‌ها با یک برچسب خاص پر می‌کند تا در مراحل و آنالیزهای بعدی قابل پیگیری باشند. (اگر سایتی از تمام فیلترها با موفقیت عبور کند، برچسب PASS دریافت می‌کند).

مثال برای فیلتر نرم:

bcftools filter -O v -e 'QUAL<=10 || (FORMAT/DP="." | FORMAT/DP<3)' -s LOWQUAL -m + input.vcf

کالبدشکافی این دستور:

  • -e: به برنامه می‌گوید واریانت‌هایی که شرایطِ عبارتِ مقابلش را دارند، فیلتر کند (در این مثال: سایت‌هایی که کیفیت QUAL مساوی/کمتر از ۱۰ دارند یا عمق خوانش DP آن‌ها کمتر از ۳ است).
  • -s LOWQUAL: به جای حذف واریانت‌های فیلترشده، برچسب “LOWQUAL” را در ستون FILTER برای آن‌ها می‌نویسد.
  • -m +: این آپشن بسیار مهم است! علامت + به برنامه دستور می‌دهد که این برچسبِ جدید را به فیلترهایی که از قبل در فایل وجود داشته‌اند اضافه کند و آن‌ها را جایگزین و پاک نکند.

فیلتر سخت (Hard Filtering) برای حذف کامل واریانت‌ها

اگر هدف شما این است که واریانت‌های بی‌کیفیت را کاملاً از فایل خروجی حذف کنید، از پارامترهای -i (include) و -e (exclude) مستقیماً روی خود دستور view یا filter (بدون آپشن -s) استفاده کنید:

bcftools view -i 'QUAL>20 && DP>10' file.vcf

در این دستور، تنها سایت‌هایی در خروجی نگه داشته می‌شوند که کیفیت بالاتر از ۲۰ و عمق پوشش بیشتر از ۱۰ داشته باشند.

با تسلط بر این ساختار منطقی، شما توانایی آن را خواهید داشت که پیچیده‌ترین شروط ریاضی را برای تمیز کردن داده‌هایتان بنویسید. اما قدرت واقعی bcftools زمانی خود را نشان می‌دهد که بخواهید این اطلاعاتِ پالایش‌شده را از ساختار پیچیده VCF خارج کرده و به جداول ساده و قابل‌فهم تبدیل کنید.

استخراج داده‌ها با Bcftools

فایل‌های VCF به دلیل حجم بالای اطلاعات و ساختار تودرتویی که دارند، برای خواندن توسط انسان یا وارد کردن به نرم‌افزارهایی مثل R و Excel چندان مناسب نیستند. دستور query ابزاری فوق‌العاده قدرتمند است که به شما اجازه می‌دهد دقیقاً فیلدهای مورد نیاز خود را انتخاب کرده و آن‌ها را با فرمت دلخواه (مثل یک جدول با جداکننده Tab) استخراج کنید.

۱. انتخاب دقیق ستون‌ها و اطلاعات دلخواه

قدرت اصلی دستور query در آپشن -f (یا --format) نهفته است. با استفاده از متغیرهایی که با علامت % شروع می‌شوند، می‌توانید هر ستونی را فراخوانی کنید.

مثال برای استخراج اطلاعات پایه: اگر بخواهید فقط نام کروموزوم، موقعیت، آلل مرجع (ref) و آلل جایگزین (alt) را به صورت یک جدول استخراج کنید، این دستور را پیشنهاد می‌کنیم:

bcftools query -f '%CHROM\t%POS\t%REF\t%ALT\n' file.vcf.gz > output.txt

نکته: در اینجا \t نشان‌دهنده فاصله (Tab) بین ستون‌ها و \n نشان‌دهنده رفتن به خط بعدی برای هر واریانت است.

۲. استخراج اطلاعات مربوط به نمونه‌ها

یکی از پیچیده‌ترین کارها در فایل‌های VCF، استخراج اطلاعات مربوط به هر نمونه است، زیرا این اطلاعات در ستون‌های مجزا قرار دارند. برای حل این مشکل یک سینتکس ویژه با استفاده از براکت [ ] وجود دارد.

طبق مستندات برنامه، هر عبارتی که داخل [ ] قرار بگیرد، برای تک‌تک نمونه‌های موجود در فایل تکرار می‌شود.

مثال برای استخراج ژنوتایپ نمونه‌ها:

bcftools query -f '%CHROM\t%POS\t%REF\t%ALT[\t%SAMPLE=%GT]\n' file.vcf.gz

خروجی این دستور بسیار خوانا خواهد بود و به این شکل چاپ می‌شود:

1 1000 A T Sample1=0/1 Sample2=1/1

چاپ هدر (Header) برای فایل خروجی:

برای اینکه جدول نهایی شما دارای عنوان ستون باشد و بدانید هر ستون متعلق به چه چیزی است، می‌توانید از آپشن -H (یا --print-header) استفاده کنید. با اضافه کردن این آپشن به دستورات بالا، bcftools به صورت خودکار نام ستون‌ها و نام نمونه‌ها را در سطر اول فایل چاپ می‌کند که برای وارد کردن داده‌ها به نرم‌افزارهای آماری بسیار ایده‌آل است.

دستور query مانند یک پل ارتباطی، داده‌های پیچیده بیوانفورماتیکی شما را به جداول ساده و قابل‌تحلیل در ابزارهای روتین تبدیل می‌کند. با ترکیب این دستور با فیلترهایی که در بخش قبل آموختیم، می‌توانید پایپلاین‌های گزارش‌گیری بسیار قدرتمندی بسازید.

اجرای انوتیشن با bcftools

فایل‌های واریانتی که در مراحل قبل تولید و فیلتر کردیم، معمولاً فاقد اطلاعات زمینه‌ای مانند شناسه‌های معتبر بین‌المللی (مثل rsID) یا اطلاعات بالینی هستند. دستور annotate ابزاری چندمنظوره است که برای افزودن اطلاعات جدید از سایر فایل‌ها، حذف اطلاعات غیرضروری، یا حتی تغییر نام کروموزوم‌ها و ایجاد IDهای سفارشی استفاده می‌شود.

۱. افزودن و حذف فیلدها

برای اضافه کردن یا حذف فیلدها از فایل VCF، از آپشن‌های -c (برای اضافه کردن) و -x (برای حذف کردن) استفاده کنید.

مثال برای حذف فیلدها: اگر بخواهید تمام فیلدهای INFO و FORMAT را حذف کنید، اما فیلدهای ژنوتایپ (GT) و PL باقی بمانند، می‌توانید دستور زیر را به کار ببرید:

bcftools annotate -x INFO,^FORMAT/GT,FORMAT/PL file.vcf

(نکته: علامت ^ در اینجا به معنای استثنا کردن از حذف است).

مثال برای افزودن فیلدها: برای اضافه کردن فیلدهای ID ، QUAL و یک تگ جدید از یک فایل مرجع (مثل src.bcf) بدون جایگزین کردن تگ‌های موجود، این دستور را پیشنهاد می‌دهیم:

bcftools annotate -a src.bcf -c ID,QUAL,+TAG dst.bcf

۲. ایجاد شناسه‌های سفارشی

بسیاری از اوقات فایل‌های VCF شما در ستون سوم (ستون ID) دارای نقطه (.) هستند، یعنی شناسه‌ای برای آن واریانت ثبت نشده است. یک آپشن بی‌نظیر به نام --set-id وجود دارد که به شما اجازه می‌دهد بر اساس موقعیت کروموزومی و آلل‌ها، یک شناسه منحصربه‌فرد برای هر واریانت بسازید.

مثال برای ساخت ID سفارشی:

bcftools annotate --set-id +'%CHROM\_%POS\_%REF\_%FIRST_ALT' file.vcf

با اجرای این دستور، اگر واریانتی فاقد ID باشد، برنامه به صورت خودکار شناسه‌ای شبیه به 1_1000000_A_G (ترکیبی از نام کروموزوم، موقعیت، آلل مرجع و اولین آلل جایگزین) برای آن تولید کرده و در ستون ID قرار می‌دهد. (علامت + به برنامه می‌گوید که فقط IDهای خالی را پر کند و به IDهای موجود دست نزند).

۳. تغییر نام کروموزوم‌ها

یکی از مشکلات رایج در بیوانفورماتیک، تفاوت نام‌گذاری کروموزوم‌ها در فایل‌های مختلف است (مثلاً در یک فایل chr1 و در فایل دیگر فقط 1 نوشته شده است). دستور annotate با استفاده از آپشن --rename-chrs و دریافت یک فایل متنی ساده (شامل نام قدیم و نام جدید)، این مشکل را به سادگی در کل فایل VCF شما اصلاح می‌کند.

دستور annotate عملاً فایل خام شما را به یک دیتای غنی و آماده‌ی تفسیر تبدیل می‌کند. اکنون فایل ما هم فیلتر شده و هم اطلاعات کامل را در بر دارد.

پلاگین‌های پیشرفته Bcftools

برنامه bcftools دارای یک فریم‌ورک قدرتمند برای اجرای افزونه‌هاست که امکانات بی‌نظیری را برای آنالیزهای تخصصی فراهم می‌کند. شما می‌توانید این پلاگین‌ها را با استفاده از دستور bcftools plugin یا با استفاده از علامت اختصاری + فراخوانی کنید. مثال برای فراخوانی پلاگین ساده‌ی شمارش:

 bcftools +counts in.vcf

۱. غنی‌سازی اطلاعات با پلاگین fill-tags

بسیاری از مواقع، فایل VCF شما فاقد آمارهای پایه‌ای مانند فراوانی آللی (AF) یا تعادل هاردی-واینبرگ (HWE) است. برای محاسبه این مقادیر، می‌توانید از پلاگین fill-tags استفاده کنید.

مثال برای استفاده از fill-tags در یک پایپلاین: برای محاسبه تگ‌های فرکانسی و سپس استخراج مستقیم آن‌ها به یک فایل زیپ‌شده، به مثال زیر توجه کنید:

bcftools +fill-tags 1000Genomes.bcf | bcftools query -f'%CHROM\t%POS\t%REF\t%ALT\t%AN\t%AC\n' | bgzip -c > AFs.tab.gz

(نکته: همان‌طور که می‌بینید، با استفاده از قابلیت Streaming، خروجیِ پلاگین مستقیماً به دستور query فرستاده شده است).

2. تبدیل فرمت تگ‌ها با پلاگین tag2tag

یکی دیگر از پلاگین‌های کاربردی، tag2tag است. در فایل‌های حجیم که دارای هزاران نمونه هستند، برخی از تگ‌ها فضای بسیار زیادی اشغال می‌کنند. با استفاده از این پلاگین می‌توانید تگ‌های مشابه (مانند GL ، PL ، GP یا تگ‌های آلل‌های محلی مثل LPL و LAD) را به یکدیگر تبدیل کنید تا فضای فایل بهینه‌تر شود.

تشخیص CNV و آنیوپلوئیدی با Bcftools

برنامه Bcftools دو دستور اختصاصی و قدرتمند به نام‌های polysomy و cnv را برای تشخیص تغییرات ساختاری و آنیوپلوئیدی ارائه می‌دهد. برای اجرای این دستورات، فایل VCF شما باید حاوی مقادیر فرکانس آلل B (تگ BAF) باشد. برای دستور cnv، وجود مقادیر Log R Ratio (تگ LRR) نیز الزامی است.

۱. تشخیص آنیوپلوئیدی و آلودگی (دستور polysomy)

این دستور ناهنجاری‌های کل کروموزوم را مستقیماً از طریق بررسی توزیع BAF تشخیص می‌دهد:

bcftools polysomy -v -o outdir/ file.vcf

نتایج در فایلی به نام dist.dat ذخیره می‌شوند (مقدار 2.0 برای دیپلوئید نرمال، 1.0 برای حذف و 3.0 برای افزایش کپی). برنامه همچنین یک اسکریپت پایتون تولید می‌کند که با دستور python outdir/dist.py می‌توانید نمودار توزیع داده‌ها را رسم کنید.

۲. تشخیص CNVها (دستور cnv)

این دستور با استفاده از فراخوانی جفت‌نمونه‌ای (Pairwise Calling)، تفاوت‌های دو نمونه را مقایسه کرده و نتایج مثبت کاذب را به شدت کاهش می‌دهد:

bcftools cnv -c control_sample -s query_sample -o outdir/ -p 0 file.vcf

استفاده از آپشن -p 0 یک ترفند عالی است؛ این آپشن به برنامه می‌گوید پس از پایان آنالیز، به طور خودکار کتابخانه matplotlib را فراخوانی کرده و نمودار CNVهای تمام کروموزوم‌ها را رسم کند.

ابزارها و منابع مکمل Bcftools

ابزار Bcftools یکی از پرکاربردترین نرم‌افزارها برای پردازش و فیلتر فایل‌های VCF و BCF است، اما در یک پایپلاین کامل تحلیل واریانت معمولاً در کنار ابزارهای دیگری نیز استفاده می‌شود. یکی از مهم‌ترین این ابزارها GATK (Genome Analysis Toolkit) است که مجموعه‌ای جامع برای فراخوانی، فیلتر و تحلیل واریانت‌ها ارائه می‌دهد. بسته به طراحی پایپلاین، GATK و Bcftools می‌توانند به‌صورت جایگزین یا مکمل یکدیگر به کار روند.

برای حاشیه‌نویسی و پیش‌بینی اثرات عملکردی واریانت‌ها، VEP (Variant Effect Predictor) از Ensembl یکی از قدرتمندترین ابزارهاست. این نرم‌افزار فایل‌های VCF را دریافت کرده و اطلاعاتی مانند پیامد مولکولی واریانت، ژن‌های تحت تأثیر، فراوانی آللی و داده‌های پایگاه‌های مختلف را به آن اضافه می‌کند.

برای بررسی بصری واریانت‌ها، IGV (Integrative Genomics Viewer) امکان مشاهده هم‌زمان فایل‌های BAM/CRAM و VCF را فراهم می‌کند. در مطالعات GWAS نیز ابزارهایی مانند LocusZoom و PheWeb برای نمایش و مرور نتایج انجمنی کاربرد دارند.

در کنار واریانت‌های کوچک (SNP و Indel)، ابزارهایی مانند CNVnator ، LUMPY و PennCNV برای شناسایی واریانت‌های ساختاری و تغییرات تعداد کپی (CNVs) به کار می‌روند و مکمل تحلیل واریانت‌های کوچک محسوب می‌شوند.

برای تحلیل داده‌های VCF در محیط R، بسته‌های VariantAnnotation و vcfR امکانات مناسبی برای خواندن، فیلتر کردن، استخراج اطلاعات ژنوتیپی و تحلیل داده‌ها ارائه می‌دهند. همچنین، پایگاه‌های داده dbSNP ، gnomAD ، ClinVar و COSMIC نقش مهمی در تفسیر زیستی و بالینی واریانت‌ها و اولویت‌بندی آن‌ها دارند.

ترکیب Bcftools با این ابزارها و منابع، یک پایپلاین جامع و استاندارد برای تحلیل و تفسیر واریانت‌های ژنومی فراهم می‌کند.

نتیجه‌گیری

Bcftools یکی از مهم‌ترین و پرکاربردترین ابزارهای متن‌باز در حوزه تحلیل واریانت‌های ژنومی است که با سرعت بالا، انعطاف‌پذیری و قابلیت پردازش داده‌ها به‌صورت جریانی (Streaming)، جایگاه ویژه‌ای در پایپلاین‌های بیوانفورماتیکی پیدا کرده است. از فراخوانی واریانت‌ها و فیلتر کردن دیتا گرفته تا استخراج اطلاعات، حاشیه‌نویسی و استفاده از پلاگین‌های تخصصی، این ابزار مجموعه‌ای کامل از قابلیت‌های موردنیاز برای مدیریت فایل‌های VCF و BCF را در اختیار پژوهشگران قرار می‌دهد. علاوه بر این، سازگاری Bcftools با ابزارهایی مانند GATK ، VEP ، IGV و بسته‌های تحلیلی R، امکان ساخت پایپلاین‌های قدرتمند و قابل اعتماد را برای پروژه‌های تحقیقاتی و بالینی فراهم می‌کند.

با این حال، موفقیت در تحلیل داده‌های ژنومی تنها به یادگیری دستورات یک نرم‌افزار محدود نمی‌شود. درک ساختار فایل‌های VCF، آشنایی با معیارهای کیفیت، انتخاب فیلترهای مناسب و تفسیر صحیح واریانت‌ها، عواملی هستند که نقش تعیین‌کننده‌ای در کیفیت نتایج نهایی دارند.

اگر بتوانید Bcftools را در کنار سایر ابزارها و پایگاه‌های داده معتبر به‌درستی به کار بگیرید، یک گام بزرگ به سمت انجام تحلیل‌های دقیق، استاندارد و قابل استناد در پروژه‌های توالی‌یابی نسل جدید (NGS) برداشته‌اید.

سوالات متداول درباره Bcftools

Bcftools چیست و چه کاربردی دارد؟

Bcftools یک نرم‌افزار متن‌باز برای فراخوانی، فیلتر، پردازش و مدیریت فایل‌های VCF و BCF است. این ابزار یکی از اجزای اصلی پایپلاین‌های تحلیل واریانت در داده‌های توالی‌یابی نسل جدید (NGS) محسوب می‌شود و به‌طور گسترده در تحقیقات ژنتیک و ژنومیک استفاده می‌شود.

Bcftools از چه فایل‌هایی پشتیبانی می‌کند؟

Bcftools به‌طور مستقیم با فایل‌های VCF و BCF کار می‌کند و همچنین می‌تواند فایل‌های BAM و CRAM را برای فراخوانی واریانت‌ها پردازش کند. این نرم‌افزار از فایل‌های فشرده‌شده با BGZF نیز پشتیبانی می‌کند.

آیا Bcftools برای Variant Calling مناسب است؟

بله. Bcftools با استفاده از دستورات mpileup و call می‌تواند SNPها و Indelها را با دقت بالا شناسایی کند و یکی از ابزارهای استاندارد برای Variant Calling در بسیاری از پایپلاین‌های NGS محسوب می‌شود.

آیا Bcftools قابلیت Annotation واریانت‌ها را دارد؟

Bcftools امکانات محدودی برای افزودن یا ویرایش اطلاعات فایل VCF دارد، اما برای حاشیه‌نویسی کامل و پیش‌بینی اثرات عملکردی واریانت‌ها معمولاً از ابزارهایی مانند VEP یا ANNOVAR در کنار آن استفاده می‌شود.

آیا Bcftools روی ویندوز اجرا می‌شود؟

Bcftools به‌طور رسمی برای لینوکس و macOS توسعه یافته است، اما کاربران ویندوز می‌توانند آن را از طریق Windows Subsystem for Linux (WSL) یا محیط‌هایی مانند Conda (کانال bioconda) بدون مشکل اجرا کنند.

پروفایل گروه بیوانفورماتیک وانیار
تیم تولید محتوای وانیار:

تیم تولید محتوای گروه بیوانفورماتیک وانیار در تلاش است تا بهترین آموزش‌های کوتاه در زمینه بیوانفورماتیک و زیست‌شناسی را تهیه نماید. صحت محتوای این صفحه توسط کارشناسان گروه بیوانفورماتیک وانیار بررسی شده است.

جدیدترین آموزک‌های بیوانفورماتیک

عضویت در مجله وانیار

چطور از جدیدترین آموزش‌ها باخبر شوم؟

با عضویت در مجله بیوانفورماتیک وانیار، برترین آموزش‌های بیوانفورماتیک را در لحظه انتشار دریافت کنید.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

سلام، وقت بخیر.
چطور میتونیم بهتون کمک کنیم؟
تیم ما آماده پاسخگویی به سوالات شماست.

پشتیبانی 24 ساعته در 7 روز هفته.