معرفی ابزار NetMHCIIpan و اهمیت آن در ایمونوانفورماتیک
NetMHCIIpan یک ابزار ایمونوانفورماتیکی مبتنی بر شبکههای عصبی مصنوعی (Artificial Neural Networks ; ANNs) است که احتمال اتصال پپتیدها به مولکولهای MHC کلاس II و ارائه طبیعی آنها را پیشبینی میکند. برای درک اهمیت این ابزار، ابتدا باید نگاهی به سیستم ایمنی بدن بیندازیم.
مولکولهای کمپلکس سازگاری نسجی اصلی کلاس دو (MHC class II) که در انسان با نام HLA کلاس II نیز شناخته میشوند، روی سطح سلولهای ارائهدهنده آنتیژن (APCs) مانند سلولهای دندریتیک، ماکروفاژها و لنفوسیتهای B بیان میشوند و نقش محوری در عملکرد سیستم ایمنی ایفا میکنند. وظیفه اصلی این مولکولها، ارائه پپتیدهای آنتیژنی به سلولهای T کمکی (CD4+ T cells) است تا پاسخ ایمنی مناسب علیه عوامل بیماریزا شکل بگیرد.

ساختار این کمپلکسها به صورت هترودایمرهایی از زنجیرههای آلفا و بتا است که توسط سه جایگاه ژنی اصلی یعنی HLA-DR ، HLA-DP و HLA-DQ کدگذاری میشوند. این جایگاهها در زمره پلیمورفیکترین (چندشکلترین) ژنها در ژنوم انسان قرار دارند که این تنوع ژنتیکی به آنها اجازه میدهد طیف بسیار وسیعی از پپتیدها را شناسایی کرده و متصل شوند.
ضرورت پیشبینی اتصال پپتید به MHC کلاس II
پیشبینی دقیق و کامپیوتری اینکه کدام پپتیدها قادرند به این مولکولهای متنوع متصل شوند، برای توسعه منطقی و هدفمند ایمونوتراپیها و واکسنهایی که بر پایه فعالسازی سلولهای T عمل میکنند، امری کاملاً حیاتی است. ایمونوپپتیدوم (مجموعه پپتیدهای ارائهشده) در سلولهای ارائهدهنده آنتیژن در واقع یک مخلوط بسیار پیچیده از پپتیدهایی است که توسط ترکیبی از مولکولهای DR ، DP و DQ ارائه شدهاند.
در گذشته، به دلیل محدودیت در دسترسی به دادههای ایمونوپپتیدومیکس باکیفیت برای مولکولهای HLA-DQ و HLA-DP، توسعهدهندگان ابزارهای پیشبینی بیوانفورماتیکی ناچار بودند بیشتر تمرکز خود را روی جایگاه HLA-DR معطوف کنند. اما برای رمزگشایی از عملکرد هر یک از این مولکولها در پیشرفت بیماریها، نیازمند ابزاری هستیم که بتواند این پیچیدگی را برطرف کرده و اتصالات مربوط به تمام جایگاههای کلاس II را به درستی شناسایی کند.
چرا NetMHCIIpan نسخه ۴.۳؟
دلیل تمرکز ما بر روی جدیدترین بهروزرسانی این ابزار، یعنی NetMHCIIpan-4.3، پیشرفت شگرف آن در غلبه بر محدودیتهای گذشته است. این نسخه توانسته شکاف عملکردی بین جایگاههای مختلف HLA-II (یعنی اختلاف دقت پیشبینی برای DR در مقابل DQ و DP) را به طور کامل پر کند.
نسخه ۴.۳ از طریق یکپارچهسازی مجموعهدادههای عظیم و اختصاصی ایمونوپپتیدومیکس که تمامی فضاهای اختصاصی HLA کلاس II را پوشش میدهد، توسعه یافته است. علاوه بر این، NetMHCIIpan-4.3 از یک چارچوب یادگیری ماشین (Machine Learning) بسیار ارتقایافته استفاده میکند که توانایی مدلسازی حالتهای جدیدی مانند «اتصال معکوس پپتید» (Inverted peptide binders) را نیز داراست. این ابزار با پوششدهی گسترده مولکولی و دقت بالا، مسیر را برای اکتشافات جدید در حوزه ایمونولوژی کامپیوتری هموار کرده است.
در بخش بعدی، عمیقتر به نوآوریها و ویژگیهای جذاب این نسخه در سطح الگوریتمی خواهیم پرداخت.
الگوریتم محاسباتی و نوآوریها در NetMHCIIpan-4.3
هسته محاسباتی ابزار NetMHCIIpan برای پیشبینی دقیق برهمکنشهای پپتید و MHC کلاس II، بر پایه یک ساختار یادگیری ماشین پیشرفته بنا شده است. نسخه 4.3 این ابزار با معرفی چندین نوآوری الگوریتمی توانسته چالشهای دیرینه بیوانفورماتیک محاسباتی ایمنی را حل کند. در ادامه، به تشریح الگوریتم اصلی، نحوه پردازش دادههای ورودی و نوآوریهای کلیدی این نسخه میپردازیم.
الگوریتم یادگیری ماشین NNAlign_MA و تفکیک موتیفها (Motif Deconvolution)
یکی از چالشهای بزرگ در تحلیل دادههای ایمونوپپتیدومیکس حاصل از طیفسنجی جرمی (LC-MS/MS)، ماهیت چنداللی (Multi-Allelic یا MA) دادههاست. به این معنی که پپتیدهای شناساییشده در یک نمونه هتروزیگوت میتوانند به هر یک از چندین مولکول HLA بیانشده در آن سلول متصل شده باشند. برای حل این مسئله و انتساب دقیق هر پپتید به الل هدف خود، الگوریتم NetMHCIIpan-4.3 از چارچوب یادگیری ماشین NNAlign_MA استفاده میکند.
بر خلاف روشهای دیگر مانند MoDec که کار تفکیک موتیف را به صورت مجزا برای هر دیتاست انجام میدهند و در شناسایی موتیفهای با فراوانی کم ناتوان هستند، الگوریتم NNAlign_MA فرآیند تفکیک موتیف را به صورت سراسری (Pan-specific) در میان تمام دیتاستها اجرا میکند. این رویکرد به مدل اجازه میدهد تا اطلاعات مربوط به اللهای مشترک را در میان نمونههای مختلف به اشتراک بگذارد و دقت تفکیک را برای موتیفهای اقلیت به شکل چشمگیری افزایش دهد. شبکه عصبی نهایی این ابزار در قالب یک Ensemble متشکل از ۱۰۰ مدل مجزا با لایههای پنهان متفاوت (۱۰۰ یا ۱۲۰ نورون) آموزش داده شده است تا پایدارترین پیشبینی ممکن را ارائه دهد.
عبارت Ensemble — که در فارسی به آن «یادگیری دستهجمعی» یا «همافزایی مدلها» نیز گفته میشود — یکی از کلیدیترین و قدرتمندترین مفاهیم در یادگیری ماشین است.
در یک تعریف ساده، به جای اینکه ما فقط یک شبکه عصبی (یک کارشناس) را آموزش دهیم و تصمیمگیری را کاملاً به او بسپاریم، چندین شبکه عصبی مختلف (در اینجا ۱۰۰ مدل مجزا) را به طور مستقل آموزش میدهیم و در نهایت برای پیشبینی نهایی، بین آنها رأیگیری یا میانگینگیری میکنیم.
پیشبینی حالت اتصال معکوس پپتید (Inverted Binding Mode)
یکی از برجستهترین نوآوریهای الگوریتمی در NetMHCIIpan-4.3، توانایی مدلسازی و پیشبینی «اتصال معکوس پپتید» است. مطالعات تجربی نشان دادهاند که برخی از پپتیدها برخلاف جهت استاندارد و طبیعی (که از انتهای N به C است)، تمایل دارند به صورت معکوس (C to N) به درون شکاف اتصال مولکولهای HLA کلاس II (بهویژه HLA-DP) متصل شوند.
برای گنجاندن این پدیده زیستی در مدل محاسباتی، نسخه جدید الگوریتم NNAlign_MA به گونهای توسعه یافته که در طول آموزش شبکههای عصبی، توالی پپتید را به صورت معکوس رمزگذاری کرده و جهت اتصال را نیز در لایه ورودی با مقادیر باینری (۰ برای اتصال مستقیم و ۱ برای اتصال معکوس) کدگذاری میکند. الگوریتم ابتدا یک دوره آغازین شامل دو دور آموزش کامل را بدون اعمال معکوسسازی طی میکند. سپس در هر دور، امتیازی را برای هر دو حالت مستقیم و معکوس محاسبه کرده و حالتی را که بیشترین امتیاز پیشبینی را کسب کند برای فرآیند پسانتشار خطا (Backpropagation) برمیگزیند. در زمان پیشبینی نهایی، جهت اتصال پپتید بر اساس اکثریت آرای شبکههای عصبیِ Ensemble گزارش میشود. این نوآوری از حذف اشتباه پپتیدهای متصلشونده معکوس به عنوان دادههای پرت (Trash) جلوگیری میکند.
رمزگذاری بافتار پروتئولیتیک (Context Encoding)
مراحل مختلف پردازش درونسلولی آنتیژن (مانند هضم پروتئینی پروتئینهای بزرگ و بارگذاری آنها روی MHC-II) تأثیر مستقیمی روی این دارد که کدام پپتیدها در نهایت روی سطح سلول ارائه شوند. الگوریتم NetMHCIIpan-4.3 این سیگنالهای پردازشی را از طریق ویژگی رمزگذاری بافتار (Context Encoding) وارد محاسبات خود میکند.
بافتار استخراج شده شامل یک توالی ۱۲ آمینواسیدی فرضی است.
۳ آمینواسید بالادست لیگاند در پروتئین منشأ، ۳ آمینواسید از انتهای N لیگاند، ۳ آمینواسید از انتهای C لیگاند، و ۳ آمینواسید پاییندست آن در پروتئین منشأ.

این اطلاعات به شبکه عصبی کمک میکند تا الگوهای برش آنزیمی پپتیدها را در سلول یاد بگیرد. اعمال این ویژگی الگوریتمی منجر به ارتقای عملکرد پیشبینی برای هر سه لوکوس شده و بیشترین میزان بهبود دقت را برای جایگاه HLA-DQ به همراه داشته است.
حذف شکاف عملکردی بین جایگاهها با دادههای اختصاصی
یک چالش محاسباتی قدیمی در ابزارهای پیشبینی MHC-II، وجود اختلاف دقت پیشبینی بین جایگاه HLA-DR و دو جایگاه دیگر (DQ و DP) به دلیل کمبود دادههای باکیفیت تجربی بود.
توسعهدهندگان NetMHCIIpan-4.3 با استفاده از آنتیبادیهای مونوکلونال کاملاً اختصاصی برای تخلیص مجزای مولکولهای HLA-DQ و HLA-DP (به جای آنتیبادیهای عمومی pan-HLA کلاس II)، حجم عظیمی از دادههای خالص و باکیفیت الوتشده را تولید و وارد آموزش الگوریتم کردند. ادغام این دادههای اختصاصیِ لوکوسمحور همراه با ارتقای الگوریتمی یادگیری ماشین، توانسته است شکاف عملکردی بین سه جایگاه اصلی HLA کلاس II را به طور کامل از بین ببرد و پوشش جمعیت جهانی این ابزار را برای هر سه لوکوس به بالای ۹۶٪ برساند.
راهنمای عملی NetMHCIIpan-4.3: فرآیند آمادهسازی و وارد کردن دیتا
کار با سرور آنلاین NetMHCIIpan-4.3 بسیار ساده و کاربرپسند است و شما میتوانید از لینک زیر به آن دسترسی پیدا کنید:
برای آموزش گامبهگام روش کار با این ابزار، از توالی پروتئینی Proteinase 3CL-Pro (پروتئاز اصلی یا Mpro) ویروس SARS-CoV-2 استفاده میکنیم. این آنزیم نقشی کلیدی در تکثیر ویروس ایفا میکند و یکی از مهمترین اهداف در مطالعات ایمونوانفورماتیک برای شناسایی اپیتوپهای سلول T و طراحی واکسن به شمار میرود.
در این بخش، مراحل ورود دادهها و تنظیم پارامترهای سرور را با استفاده از توالی FASTA زیر که مربوط به این پروتئین است، انجام میدهیم:
>QHD43415_5
SGFRKMAFPSGKVEGCMVQVTCGTTTLNGLWLDDVVYCPR
HVICTSEDMLNPNYEDLLIRKSNHNFLVQAGNVQLRVIGH
SMQNCVLKLKVDTANPKTPKYKFVRIQPGQTFSVLACYNG
SPSGVYQCAMRPNFTIKGSFLNGSCGSVGFNIDYDCVSFC
YMHHMELPTGVHAGTDLEGNFYGPFVDRQTAQAAGTDTTI
TVNVLAWLYAAVINGDRWFLNRFTTTLNDFNLVAMKYNYE
PLTQDHVDILGPLSAQTGIAVLDMCASLKELLQNGMNGRT
ILGSALLEDEFTPFDVVRQCSGVTFQ
فرآیند آمادهسازی و ثبت درخواست در سه بخش اصلی انجام میشود:
۱. بخش وارد کردن دادهها (INPUT DATA)
در اولین بخش از صفحه سرور، باید نوع دیتای ورودی خود را مشخص کرده و توالی پروتئینی را بارگذاری کنید:

- انتخاب نوع داده ورودی (INPUT TYPE): یکی از سه گزینه زیر را انتخاب کنید:
- Fasta: اگر توالی کامل پروتئین را در اختیار دارید (مانند توالی 3CL-Pro ما)، این گزینه را انتخاب کنید. سرور بهطور خودکار پروتئین را به پپتیدهای همپوشان با طول مشخص (پیشفرض ۱۵تایی) برش میدهد و اتصال تمام آنها را پیشبینی میکند.
- Peptide: اگر لیستی از پپتیدهای مشخص را دارید، این گزینه را انتخاب کنید.
- Peptide-MHC: برای ارزیابی جفتهای مشخص از پپتید-MHC استفاده میشود.
- فعالسازی رمزگذاری بافتار (Use context encoding): این ویژگی به شبکه عصبی اجازه میدهد تا بافتار پروتئولیتیک اطراف پپتید (الگوهای برش آنزیمی در سلول) را در محاسبات خود لحاظ کند. اگر فرمت ورودی شما FASTA باشد، با فعال کردن این گزینه، سرور به طور خودکار توالیهای بافتار ۱۲ آمینواسیدی را استخراج میکند. تیک این گزینه را بزنید.
- وارد کردن توالی: توالی FASTA پروتئین 3CL-Pro را در کادر متنی بزرگ پیست کنید. همچنین میتوانید توالی را در قالب یک فایل متنی آپلود کنید.
- نکته مهم علمی: سرور حروف الفبای آمینواسیدهای استاندارد را به صورت غیرحساس به حروف بزرگ و کوچک میپذیرد. هر کاراکتر غیرمجاز دیگری به حرف X (آمینواسید ناشناخته) تبدیل خواهد شد. در هر بار ثبت درخواست، حداکثر ۵۰۰۰ توالی مجاز است و طول هر توالی باید بین ۹ تا ۲۰,۰۰۰ آمینواسید باشد.
- تعیین طول پپتید (PEPTIDE LENGTH): از آنجا که فرمت ورودی را FASTA انتخاب کردهاید، باید طول پپتیدهای حاصل از هضم پروتئین را مشخص کنید. مقدار پیشفرض 15 (پپتیدهای ۱۵تایی یا 15-mer) است که مناسبترین طول برای ارزیابی MHC کلاس II به شمار میرود. اگر مایل به ارزیابی طولهای متفاوتی هستید، میتوانید آنها را با کاما از هم جدا کنید (مثلاً 13,15). در این مثال، عدد 15 را دستنخورده باقی بگذارید.
۲. بخش انتخاب مولکولهای MHC
در این بخش باید مشخص کنید که میخواهید اتصال پپتیدهای حاصل از پروتئین 3CL-Pro به کدام مولکولهای MHC کلاس II پیشبینی شود:

- روش اول (انتخاب از لیست): میتوانید اللهای موردنظر خود را از منوی کشویی انتخاب کنید. دسته MS-COVERED شامل تمامی مولکولهایی است که دادههای تجربی ایمونوپپتیدومیکس آنها در آموزش سرور نسخه ۴.۳ استفاده شده و بالاترین دقت پیشبینی را دارند.
- روش دوم (تایپ دستی نام الل): نام اللهای موردنظر را مستقیماً در کادر مربوطه تایپ کنید (هم زنجیره آلفا و هم بتا باید مشخص شوند). برای مثال، برای بررسی پپتیدهای متصلشونده به یک الل DP معروف، میتوانید عبارت زیر را تایپ کنید:
HLA-DPA10202-DPB11901 - روش سوم (وارد کردن توالی جدید): اگر مولکول مورد نظر شما در لیست پیشفرض نیست، میتوانید توالی کامل آمینواسیدی زنجیرههای آلفا و بتا را در فرمت FASTA آپلود کنید. البته در این حالت پیشبینی Rank score فعال نخواهد بود مگر اینکه شبهتوالی ایجاد شده از آن در فایلهای پیشمحاسبهشده سرور موجود باشد.
- توجه: اگر در بخش اول، نوع ورودی را روی Peptide-MHC تنظیم کرده باشید، این بخش به شما نشان داده نخواهد شد.
۳. بخش تنظیمات پیشرفته (ADDITIONAL CONFIGURATION)
پیش از ارسال درخواست، سرور گزینههای مختلفی برای شخصیسازی خروجی در اختیار شما قرار میدهد که بر اساس نیاز خود میتوانید آنها را تنظیم کنید:

- آستانه تعیین اتصالها (Threshold for strong/weak binder). بهطور پیشفرض، پپتیدهایی با %Rank کمتر از ۱٪ به عنوان اتصالدهنده قوی (SB) و بین ۱٪ تا ۵٪ به عنوان اتصالدهنده ضعیف (WB) دستهبندی میشوند. میتوانید این مقادیر را تغییر دهید.
- پیشبینی تمایل اتصالی (Include BA predictions). با فعال کردن این گزینه، علاوه بر احتمال حضور لیگاند (Eluted Ligand)، مقدار تمایل اتصالی پپتید به صورت کمّی (بر حسب نانومولار IC50) نیز در خروجی محاسبه و نمایش داده میشود.
- فعالسازی پیشبینی اتصال معکوس برای سایر جایگاهها (Allow peptide inversion for other loci than HLA-DP). به طور پیشفرض، الگوریتم NetMHCIIpan-4.3 ویژگی اتصال معکوس را بهدلیل صرفهجویی در زمان پردازش محاسباتی، فقط برای اللهای HLA-DP بررسی میکند. اگر میخواهید این احتمال را برای اللهای DR و DQ نیز بسنجید، تیک این گزینه را فعال کنید.
- فیلتر کردن خروجی (Turn on filtering options). این گزینه به شما امکان میدهد خروجیهای شلوغ را فیلتر کرده و تنها پپتیدهایی را که %Rank آنها از یک حد مشخص پایینتر است، نمایش دهید. این ابزار برای پروتئینهای بزرگ یا حجم توالی بالا بسیار کاربردی است.
- نمایش قویترین هسته اتصال (Print only the strongest binding core). با فعال کردن این گزینه، سیستم از بین پپتیدهای تکراری یا همپوشان، تنها موردی را که بهترین هسته اتصال (Core) را دارد در خروجی نهایی چاپ میکند.
- مرتبسازی نتایج (Sort output by prediction score): خروجی را بر اساس بالاترین امتیاز پیشبینی اتصال مرتب میکند که دسترسی به بهترین اپیتوپها را سریعتر میسازد. (توصیه میشود این گزینه فعال باشد).
- ذخیره خروجی به فرمت اکسل (Save predictions to xls file). یک فایل خروجی با فرمت
.XLSتولید میکند که برای تحلیلهای بعدی در سیستم شخصی بسیار مناسب است.
۴. ثبت و ارسال درخواست (SUBMISSION)
پس از اتمام تنظیمات، برای ارسال محاسبات به سرور روی دکمه Submit کلیک کنید. همچنین در صورت نیاز به بازنشانی فرم، میتوانید دکمه Clear fields را بزنید.
پس از کلیک بر روی دکمه ارسال، وضعیت کار شما در حالت «در صف انتظار» (queued) یا «در حال اجرا» (running) قرار میگیرد. شما همچنین میتوانید ایمیل خود را در کادر مربوطه وارد کنید تا به محض پایان محاسبات، لینک دسترسی به نتایج برای شما ارسال شود.
تحلیل و تفسیر خروجیهای سرور NetMHCIIpan-4.3
پس از ثبت توالیها و فشردن دکمه ارسال، سرور فرآیند محاسبات را آغاز کرده و در نهایت صفحهای حاوی جدول نتایج را صادر میکند. در این بخش، مفاهیم زیستی و ریاضیاتی پشت تکتک بخشهای گزارش خروجی را بررسی میکنیم.

شناسنامه گزارش خروجی NetMHCIIpan
در بالاترین بخش خروجی سرور، کادری حاوی اطلاعات ساختاری و روشهای آنالیزی قرار دارد که به منزله «شناسنامه آنالیز» شماست. فهم این پارامترها برای گزارش علمی نتایج ضروری است:
- Prediction Mode (حالت پیشبینی): در این مثال عبارت
EL with Contextدرج شده است. این یعنی الگوریتم علاوه بر بررسی تمایل فیزیکی اتصال پپتید، Context Encoding یعنی توالیهای اطراف لیگاند در پروتئین مادری را نیز رمزگذاری کرده تا شبیهسازی دقیقتری از هضم آنزیمی درونسلولی ارائه دهد. این کار دقت پیشبینی را به طور چشمگیری افزایش میدهد. - Distance to training data (فاصله تا دادههای آموزشی): در گزارش ما برای الل HLA-DPA10202-DPB11901، این مقدار برابر 0.000 محاسبه شده است. در ایمونوانفورماتیک، این شاخص نشان میدهد که الل انتخابی شما چقدر به اللهای استفادهشده در فاز آموزش شبکههای عصبی نزدیک است. عدد صفر یعنی این الل دقیقاً در دادههای آموزش وجود داشته و پیشبینیها در بالاترین سطح اعتماد قرار دارند.
ستونهای جدول خروجی NetMHCIIpan
جدول نتایج سرور از ستونهای متعددی تشکیل شده است که هر یک حاوی یک مفهوم محاسباتی یا بیولوژیکی مهم هستند:
| نام ستون | تعریف بیوانفورماتیکی و کاربرد آموزشی |
|---|---|
| Pos | موقعیت آمینواسید آغازین پپتید ۱۵تایی در کل توالی پروتئین منشأ (شروع محاسبات از عدد ۱) |
| MHC | نام دقیق هترودایمر HLA کلاس II که پیشبینی برای آن انجام شده است. |
| Peptide | توالی پپتید ارزیابیشده (در مثال ما به دلیل ورودی FASTA، پپتیدهای همپوشان با طول ۱۵ آمینواسید هستند) |
| Of (Offset) | آفست شروع هسته اتصال؛ یعنی از آمینواسید شماره چندم پپتید ۱۵تایی، هسته اصلی ۹تایی آغاز میشود (شروع از صفر) |
| Core | هسته اتصال ۹تایی (Binding Core)؛ بخش کلیدی پپتید که فیزیک آن مستقیماً درون شکاف اتصال (Binding Groove) مولکول MHC-II قرار میگیرد. |
| Core_Rel | میزان پایداری یا قابلیت اطمینان هسته؛ کسر توافق شبکههای عصبیِ درون Ensemble بر روی آفست و جهتگیری انتخابشده. هرچه به ۱ نزدیکتر باشد، نشاندهنده قاطعیت بالای مدل در تعیین موتیف است. |
| Inverted | جهتگیری فیزیکی اتصال پپتید؛ مقدار ۰ نشاندهنده اتصال کانونیکال (N به C) و مقدار ۱ نشاندهنده اتصال معکوس (C به N) است. |
| Score_EL | امتیاز خام احتمال لیگاند الوتشده؛ خروجی مستقیم شبکه عصبی بدون نرمالسازی. |
| %Rank_EL | رتبه درصدی نمره پیشبینی؛ رتبه امتیاز پپتید شما در مقایسه با مجموعهای از ۱۰۰,۰۰۰ پپتید طبیعی تصادفی. این شاخص معیار اصلی قضاوت است. |
| BindLevel | سطح اتصال نهایی؛ پپتیدها را بر اساس آستانههای پیشفرض به دو دسته SB (اتصال قوی) یا WB (اتصال ضعیف) طبقهبندی میکند. |
آموزش تحلیل %Rank و لزوم عبور از نمرههای خام
مولکولهای MHC کلاس II تنوع ژنتیکی بسیار بالایی دارند و شکاف اتصال آنها (Binding Groove) از نظر ساختار فیزیکی و بارهای الکتریکی آمینواسیدهای سازنده، با یکدیگر متفاوت است.
برخی از مولکولهای MHC به دلیل فیزیک خاص خود، اصطلاحاً بسیار “چسبنده” هستند و تمایل دارند به تعداد زیادی از پپتیدها متصل شوند؛ بنابراین مدل شبکۀ عصبی به طور ذاتی به پپتیدهای این اللها نمرات خام بالا (Score_EL) میدهد. برخی دیگر بسیار گزینشی و سختگیر عمل میکنند و نمرات خام پیشبینی آنها به طور طبیعی بسیار پایین است.
به همین دلیل، مقایسه مستقیم Score_EL بین اللهای مختلف علمی و دقیق نیست.
سرور NetMHCIIpan برای حل این مشکل، شاخص %Rank_EL (رتبه درصدی) را معرفی میکند. این شاخص، نمره پیشبینی پپتید شما را با مجموعهای مرجع شامل ۱۰۰,۰۰۰ پپتید طبیعی تصادفی بر روی همان مولکول MHC میسنجد. از آنجا که این معیار تحت تأثیر سوگیری فیزیکی اللها قرار نمیگیرد، مبنای اصلی تصمیمگیری است.
بر این اساس، پپتیدها طبق آستانههای پیشفرض سرور دستهبندی میشوند:
- اتصالدهنده قوی (SB – Strong Binder): پپتیدهایی با رتبه درصدی کمتر از ۱٪ .
- اتصالدهنده ضعیف (WB – Weak Binder): پپتیدهایی با رتبه درصدی بین ۱٪ تا ۵٪ .
تفسیر بیولوژیکی پدیده اتصال معکوس پپتید در نتایج
بزرگترین مزیت ابزار NetMHCIIpan-4.3 نسبت به رقبای قدیمیتر، مدلسازی حالتی است که در آن پپتید بهصورت برعکس در شکاف اتصال مولکول HLA قرار میگیرد. این فرآیند تقریباً بهطور اختصاصی در مولکولهای HLA-DP (به ویژه آنهایی که دارای زنجیره آلفای DPA1*02:01 یا DPA1*02:02 هستند) به دلیل ساختار فضایی خاص جیب P1 رخ میدهد.
به پپتید موقعیت 86 در گزارش خروجی نگاه کنید:
- توالی پپتید ۱۵تایی:
VLKLKVDTANPKTPK - هسته اتصال معرفی شده:
KPNATDVKL - ستون Inverted: مقدار ۱ (تاییدکننده اتصال معکوس)
تحلیل: اگر توالی پپتید را از موقعیت آفست ۳ (آمینواسید L) به طور طبیعی بخوانیم، توالی کانونیکال LKVDTANPK به دست میآید. اما الگوریتم هوشمند با معکوس کردن این توالی در لایه ورودی شبکه عصبی و شبیهسازی جهتگیری فیزیکی C به N، هسته اتصال را به صورت برعکس یعنی KPNATDVKL ثبت کرده است.
در نرمافزارهای قدیمی که قابلیت پردازش اتصال معکوس را نداشتند، این پپتید به دلیل نداشتن انطباق با موتیف کانونیکال به عنوان دیتای پرت یا غیرمتصل رها میشد. اما در نسخه ۴.۳، این اپیتوپهای ارزشمند نجات داده شده و به لیست کاندیدهای واکسن اضافه میشوند. نمونه دیگر این پدیده در خروجی ما، پپتید موقعیت 259 با هسته معکوس KLSACMDLV است.
تفسیر علمی و همبستگی نتایج اپیتوپهای پروتئین 3CL-Pro
بر اساس گزارش سرور، در کل توالی پروتئین 3CL-Pro ویروس SARS-CoV-2 برای مولکول HLA مورد نظر، تعداد ۰ اتصالدهنده قوی (SB) و تنها ۴ اتصالدهنده ضعیف (WB) شناسایی شده است.
این ۴ پپتید که امتیاز آنها در محدوده اتصال ضعیف قرار گرفته است، الگوی همپوشانی زیر را نشان میدهند:
موقعیت ۵۸:
LIRKSNHNFLVQAGN(رتبه: ۱.۹۸٪ – WB)
موقعیت ۵۷:LLIRKSNHNFLVQAG(رتبه: ۲.۷۸٪ – WB)
موقعیت ۵۶:DLLIRKSNHNFLVQA(رتبه: ۳.۴۱٪ – WB)
موقعیت ۵۵:EDLLIRKSNHNFLVQ(رتبه: ۴.۷۸٪ – WB)
از دیدگاه بیوانفورماتیکی، جالب است که الگوریتم برای هر ۴ پپتید متوالی (موقعیت ۵۵ تا ۵۸)، یک هسته اتصال ۹تایی مشترک یعنی KSNHNFLVQ را پیشنهاد داده است. در زیستشناسی سیستم ایمنی، به این پدیده پپتیدهای لانهگزیده (Nested Peptides) میگویند؛ یعنی پپتیدهایی با طولهای مختلف که همگی حول یک هسته مرکزی قرار دارند.
اگرچه این پدیده تایید میکند که سیستم هضم سلولی به طور طبیعی مایل است پپتیدها را حول این هسته برش دهد، اما از نظر قدرت اتصال، %Rank این پپتیدها فراتر از ۱.۹۸٪ نرفته است. این یعنی برهمکنش فیزیکی پپتید با این الل خاص DP در مرز ضعیف قرار دارد و با وجود توافق بالای الگوریتم بر روی هسته اتصال، نمیتوان روی آن به عنوان یک اپیتوپ اصلی و قوی برای طراحی واکسن حساب کرد.
فقدان کامل اتصالدهندههای قوی در کل این پروتئین ۳۰۶ آمینواسیدی نشان میدهد که پروتئاز اصلی ویروس SARS-CoV-2 پتانسیل ایمونوژنیک بسیار پایینی برای ارائه توسط مولکول HLA-DPA1*02:02-DPB1*19:01 دارد. این یک یافته علمی بسیار مهم است؛ زیرا نشان میدهد برخی از افراد جامعه که دارای این آلل خاص DP هستند، ممکن است پاسخ ایمنی CD4+ T ضعیفتری را نسبت به این پروتئین خاص ویروسی نشان دهند.
مقایسه NetMHCIIpan با نسخههای پیشین و ابزارهای مشابه
ارزیابی عملکرد و مقایسه ابزارهای بیوانفورماتیکی با یکدیگر، یکی از استانداردترین روشها برای اثبات کارایی و دقت الگوریتمهای جدید است. ابزار NetMHCIIpan در مسیر توسعه خود دستخوش تغییرات شگرفی شده و همواره تلاش کرده است تا جایگاه خود را بهعنوان دقیقترین ابزار پیشبینی اتصال پپتید به MHC کلاس II تثبیت کند.
در این بخش، به مقایسه عملکردی نسخه NetMHCIIpan-4.3 با نسخه قبلی آن (NetMHCIIpan-4.2) و ابزار رقیب و شناختهشده این حوزه یعنی MixMHC2pred-2.0 بر اساس دادههای بنچمارک مقالات مرجع میپردازیم.
ارزیابی عملکرد در شناسایی اپیتوپهای CD4+
برای ارزیابی عادلانه و بدون سوگیری، توسعهدهندگان ابزار اقدام به طراحی یک بنچمارک مستقل بر روی دیتابیس اپیتوپهای ایمنی (IEDB) کردند.
- ساختار بنچمارک: در این سنجش، مجموعهای از اپیتوپهای CD4+ T واقعی و تاییدشده تجربی با طول ۱۲ تا ۲۱ آمینواسید استخراج گردید. بهمنظور حذف هرگونه سوگیری تجربی، تمامی پپتیدهایی که در دادههای آموزشی اولیه ابزار NetMHCIIpan-4.3 وجود داشتند، کاملاً از این ارزیابی حذف شدند تا مدل با دادههایی کاملاً جدید مواجه شود.
- روش ارزیابی: برای هر اپیتوپ و پروتئین منبع آن، پپتیدهای همپوشان با طول یکسان تولید شدند؛ اپیتوپ واقعی به عنوان دیتای مثبت و سایر پپتیدها به عنوان دیتای منفی برچسبگذاری شدند. سپس شاخص مساحت زیر نمودار (AUC) برای تکتک آنها محاسبه گردید.
نتایج مقایسه عملکردی (Benchmark Results)
بر اساس نتایج حاصل از ارزیابی ۸۴۲ ترکیب مختلف از پروتئین-MHC-اپیتوپ، ابزار NetMHCIIpan-4.3 توانست با اختلاف معنیداری از رقبای خود پیشی بگیرد:
- برتری بر MixMHC2pred-2.0: ابزار NetMHCIIpan-4.3 عملکرد فوقالعاده قویتری را نسبت به آخرین نسخه ابزار رقیب یعنی MixMHC2pred-2.0 ثبت کرد. P = 0.007 در آزمون باینومیکال یکدامنه (One-tailed Binomial Test).
- برتری بر نسخه قبلی (NetMHCIIpan-4.2): نسخه ۴.۳ پیشرفت آماری کاملاً معنیداری را نسبت به نسخه ۴.۲ خود نشان داد (P = 0.031).
یک نکته علمی مهم برای محققین: هرچند این بنچمارک برتری مطلق نسخه ۴.۳ را تایید میکند، اما به دلیل ماهیت تاریخی دادههای آزمایشگاهی ثبتشده در دیتابیس IEDB، بخش عمدهای از دادههای این سنجش بر روی لوکوس HLA-DR متمرکز بودهاند. انتظار میرود تفاوت واقعی و برتری چشمگیر نسخه ۴.۳ در لوکوسهای HLA-DP و HLA-DQ (به دلیل مدلسازی اتصال معکوس و استفاده از دادههای اختصاصی جدید) بسیار فراتر از نتایج این بنچمارک عمومی باشد.
مقایسه الگوریتمی: تفاوت NNAlign_MA و Deep Motif Deconvolution
تفاوت اصلی ابزار NetMHCIIpan-4.3 با ابزارهای مبتنی بر روشهای تفکیک موتیف عمیق (مانند MoDec و MixMHC2pred)، در معماری مدیریت نمونههای چنداللی (Multi-Allelic) نهفته است.
- رویکرد MixMHC2pred (Deconvolution به ازای هر دیتاست): این ابزار فرآیند تفکیک موتیف را بهصورت مجزا برای هر دیتاست انجام میدهد. این ساختار باعث میشود در شناسایی موتیفهای اقلیت (جایگاههای ژنی کمتکرار یا اللهای کمیاب) که پپتیدهای بسیار کمی در یک نمونه دارند، با افت دقت جدی مواجه شود.
- رویکرد NetMHCIIpan-4.3 (یادگیری سراسری یا Pan-specific با NNAlign_MA): در این ابزار، الگوریتم بهطور همزمان اطلاعات تمام مجموعهدادهها را به صورت یکپارچه تحلیل میکند. این یعنی اگر یک الل در چندین نمونه مختلف مشترک باشد، الگوریتم اطلاعات موتیف اتصال آن را بین همه نمونهها به اشتراک میگذارد و موتیفهای بسیار نادر یا کمتکرار را نیز با دقت بالا تفکیک میکند.
جهش بزرگ در پوشش جمعیت جهانی
یکی از ملموسترین مقایسهها بین نسخههای مختلف، بررسی میزان پوشش جامعه آماری یا جمعیت جهانی است که بهویژه در حوزه طراحی واکسنهای چنداللی اهمیت حیاتی دارد.
- مدلهای فاقد دادههای تخصصی DP: در گذشته به دلیل فقر شدید دادههای تجربی لوکوس DP، میزان پوشش عملکردی اللهای این لوکوس توسط نرمافزارها تنها حدود ۶۱٪ از جمعیت جهانی را شامل میشد.
- نسخه NetMHCIIpan-4.3 (با تلفیق دادههای Balen_DP): پس از ادغام مجموعهدادههای عظیم و اختصاصی DP در فرآیند آموزش نسخه ۴.۳، میزان پوشش عملکردی به شکل شگفتانگیزی ارتقا یافت و در نهایت به بالای ۹۶٪ پوشش جمعیت جهانی برای هر سه لوکوس (DR , DQ , DP) رسید.
دقت و انطباق موتیف اتصال با معیار ریاضیاتی KLD
برای سنجش میزان موفقیت شبکههای عصبی در «یادگیری واقعی» فیزیکِ اتصال، محققان از معیاری به نام انحراف کولبک-لایبلر (Kullback-Leibler Divergence – KLD) استفاده میکنند که به عنوان شاخص سنجش فاصله بین موتیف پیشبینیشده مدل و موتیف واقعی تجربی شناخته میشود. هر چه مقدار KLD کمتر باشد، موتیف پیشبینیشده با واقعیت بیولوژیکی انطباق بیشتری دارد.
طبق آنالیزهای آماری بر روی ۱۹ مولکول HLA-DP در دادههای مرجع:
- مدلهایی که بدون مجموعهدادههای نوین DP آموزش دیدهاند، مقادیر KLD بسیار بالایی داشتند (عدم توانایی در پیشبینی موتیف اللهای DP).
- اعمال قابلیت اتصال معکوس پپتید (Peptide Inversion) در نسخه ۴.۳، منجر به کاهش چشمگیر و معنیدار مقادیر KLD نسبت به مدلهای فاقد این ویژگی گردید (P = 0.0077). این بهبود ریاضیاتی به این دلیل است که الگوریتم ۴.۳ یاد گرفته است آمینواسیدهای لنگرگاهی مانند لایزین (K) را در پپتیدهای معکوس به جای موقعیت P9 به درستی در موقعیت P1 شکاف اتصال قرار دهد و موتیف واقعی را شبیهسازی کند.
نتیجهگیری
ابزار NetMHCIIpan-4.3 با پر کردن موفقیتآمیز شکاف عملکردی و محاسباتی بین سه جایگاه ژنی اصلی HLA کلاس II (یعنی DR ، DQ و DP)، تحولی بزرگ در حوزه ایمونولوژی محاسباتی ایجاد کرده است. این موفقیت علمی و پیشرفت چشمگیر نسبت به نسخههای گذشته، از طریق ادغام مجموعهدادههای عظیم ایمونوپپتیدومیکس حاصل از آنتیبادیهای اختصاصی، الگوریتم پیشرفته یادگیری ماشین برای مدلسازی اتصال معکوس پپتیدها و همچنین رمزگذاری بافتار برش پروتئولیتیک به دست آمده است.
در نهایت، دستیابی به پوشش بیسابقه بالای ۹۶ درصد از جمعیت جهانی برای هر سه لوکوس کلاس دو، این ابزار را به مطمئنترین پایه برای شناسایی اپیتوپهای CD4+ T، مدلسازی بیماریهای خودایمنی و طراحی منطقی نسل جدید واکسنها و ایمونوتراپیهای اختصاصی سرطان تبدیل کرده است.
آموزشهای مرتبط 🙂
سوالات متداول درباره NetMHCIIpan
این ابزار برای پیشبینی کامپیوتری و دقیق میزان اتصال پپتیدهای آنتیژنی به مولکولهای HLA کلاس II (شامل سه جایگاه DR ، DQ و DP) جهت طراحی واکسن و توسعه ایمونوتراپی استفاده میشود
این نسخه با تلفیق دادههای تجربی لوکوسمحور جدید و ارتقای الگوریتمی، عملکرد پیشبینی بسیار قویتری ارائه میدهد و پدیده «اتصال معکوس پپتید» را برای اولین بار مدلسازی میکند.
شما میتوانید دادههای خود را به صورت توالی کامل پروتئین (FASTA)، لیست پپتیدها (Peptide) یا جفتهای پپتید-MHC وارد سرور کنید.
ه طور پیشفرض، پپتیدهایی با %Rank کمتر از ۱٪ به عنوان اتصالدهنده قوی (SB) و پپتیدهای بین ۱٪ تا ۵٪ به عنوان اتصالدهنده ضعیف (WB) دستهبندی میشوند.
این قابلیت به صورت پیشفرض و خودکار تنها برای مولکولهای HLA-DP که از نظر فیزیکی مستعد این نوع اتصال هستند، فعال است.


