محاذاة إحصائية سريعة
برنامج المحاذاة الإحصائية السريعة ( FSA ) هو برنامج لمحاذاة التسلسلات المتعددة ، يُستخدم لمحاذاة العديد من البروتينات، أو الحمض النووي الريبوزي ( RNA) ، أو تسلسلات الحمض النووي الجينومي الطويلة . إلى جانب برنامجي MUSCLE و MAFFT ، يُعد FSA من البرامج القليلة القادرة على محاذاة مجموعات بيانات تضم مئات أو آلاف التسلسلات. يستخدم FSA معيار تحسين مختلفًا يسمح له بتحديد التسلسلات غير المتجانسة بدقة أكبر من البرامج الأخرى، على الرغم من أن هذه الدقة العالية تأتي على حساب انخفاض السرعة.
يتم استخدام FSA حاليًا في العديد من المشاريع، بما في ذلك تسلسل جينومات الديدان الجديدة وتحليل ارتباط عامل النسخ في الجسم الحي في الذباب.
المدخلات/المخرجات
يقبل هذا البرنامج التسلسلات بتنسيق FASTA ويخرج عمليات المحاذاة بتنسيق FASTA أو تنسيق ستوكهولم .
الخوارزمية
تتكون خوارزمية محاذاة تسلسلات الإدخال من 4 مكونات أساسية.
نموذج ماركوف المخفي الزوجي لتوليد الاحتمالات اللاحقة
تبدأ الخوارزمية أولاً بتحديد الاحتمالات اللاحقة للمحاذاةبين أي سلسلتين عشوائيتين من مجموعة السلاسل المراد محاذاتهما. تعزز الاحتمالات اللاحقة لكل عمود التنبؤ باحتمالية المحاذاة بين زوج من السلاسل، كما تعمل على استبعاد الأعمدة التي قد لا تكون محاذاتها موثوقة. تسمح هذه الاحتمالات أيضًا بالتنبؤ بالتشابه بين أي زوج من السلاسل وتقديره. يُستخدم نموذج ماركوف المخفي القياسي ذو الخمس حالات (Pair HMM) لتحديد هذه الاحتمالات اللاحقة للمحاذاة لأي سلسلتين مُدخلتين. يستخدم نموذج Pair HMM مجموعتين من حالات الحذف (D) والإدراج (I) لمراعاة حذف الرموز وإدراجها بين سلسلتين محاذيتين، ولكنه قد يحتوي أيضًا على ثلاث حالات دون فقدان كبير في الدقة.
نظرًا لأن عدد المقارنات الثنائية اللازمة لتحديد توزيعات الاحتمالية اللاحقة لأي زوجين من التسلسلات مكلف حسابيًا ويتناسب طرديًا مع مربع عدد التسلسلات التي تتم محاذاتها، يتم تقليله باستخدام منهجية عشوائية مستوحاة من نظرية إردوس-ريني للرسوم البيانية العشوائية. هذا يقلل بشكل كبير من أوقات تشغيل مجموعات البيانات والتكلفة الحسابية لتشغيل عمليات المحاذاة المتعددة.
احتمالات الدمج
يتم فرز الاحتمالات اللاحقة لكل عمود في أزواج التسلسل باستخدام دالة ترجيح تستخدم خوارزمية الصعود الأسرع.
تلدين التسلسل
تعتمد معظم البرامج الحالية التي تُشغّل خوارزميات محاذاة التسلسلات المتعددة على المحاذاة التدريجية، حيث تبدأ العملية بمحاذاة فارغة، أي حالة لم تتم فيها محاذاة أي من التسلسلات. ثم تتم محاذاة مجموعة التسلسلات إما من خلال مقارنات ثنائية أو من خلال محاذاة زوج من المحاذاة الجزئية للتسلسلات الفرعية. قد تُسبب هذه العملية مشاكل في المحاذاة لأن محاذاة التسلسلات المتعددة الناتجة تعتمد بشكل كبير على التسلسلات التي تمت محاذاتها في البداية. ولا يُمكن إعادة محاذاة التسلسلات التي تمت محاذاتها مسبقًا لتصحيح محاذاة التسلسلات المتعددة.
تستخدم خوارزمية FSA تقنية تلدين التسلسل للتغلب على هذه المشكلة. تُستخدم الاحتمالات اللاحقة المرتبة مع تقنية تلدين التسلسل لإنشاء محاذاة متعددة. تجد هذه التقنية المحاذاة بين تسلسلين تُقلل المسافة المتوقعة إلى التسلسل الصحيح. في هذه الحالة، تُعرَّف المسافة بين تسلسلين بأنها عدد الأعمدة التي لا يكون فيها الحرف من أحد التسلسلين متماثلًا مع الحرف الموجود في نفس العمود من التسلسل الآخر.
تعتمد تقنية تلدين التسلسل، من خلال تحديد محاذاة ذات أقصر مسافة متوقعة إلى التسلسل الصحيح، على إيجاد المحاذاة ذات أعلى دقة متوقعة. وتعتمد دقة المحاذاة على محاذاة "صحيحة" كمرجع، وتشير إلى نسبة الأعمدة التي تتشابه فيها التسلسلات. تُستخدم هذه الدقة كدالة هدف تبدأ بالتسلسلات غير المحاذية (محاذاة فارغة) وتُحاذي الأحرف في أعمدة مختلفة بناءً على زيادة دقة المحاذاة.
ترتيب المحاذاة
يقوم برنامج FSA بمحاذاة التسلسلات المتعددة بناءً على التشابه داخل الأعمدة بدلاً من الاعتماد فقط على عمليات الإدخال والحذف والاستبدال. ولذلك، يعتبر FSA المحاذاة متكافئة إذا أمكن تحديد التشابه نفسه لكل موضع على طول التسلسلات في كلتا المحاذاتين. على سبيل المثال، عند إجراء مقارنات ثنائية، إذا وُجدت فجوة في موضع محدد في محاذاتين، فيمكن القول إن التسلسلين المُقارنين غير متماثلين في ذلك الموضع. قد ينتج عن ذلك محاذات تختلف فيها أحداث فتح الفجوات، ومع ذلك تُعتبر متكافئة. لذا، يختار FSA إخراج المحاذاة التي تحتوي على أقل عدد ممكن من "فتح الفجوات".
التوازي
لمعالجة مجموعات البيانات الضخمة، تستطيع خوارزمية FSA تقسيم مهمة إجراء جميع المقارنات الثنائية والمحاذاة اللازمة إلى معالجات مختلفة. ويتم ذلك باستخدام استراتيجية "تقسيم البيانات إلى أجزاء ثابتة الحجم" التي توزع المقارنات الثنائية على كل معالج متاح على شكل أجزاء. وبذلك، يستطيع كل معالج إجراء حساب الاحتمالية اللاحقة على جزء من المقارنات الثنائية قبل دمج البيانات المجمعة مرة أخرى في معالج واحد لإجراء عملية تلدين التسلسل.
التصور
يمكن عرض نتائج محاذاة التسلسلات المتعددة باستخدام برنامج FSA عبر واجهة المستخدم الرسومية الخاصة به. تتيح هذه الواجهة عرض وتلوين مقاييس جودة المحاذاة المختلفة على أعمدة الأحرف ضمن المحاذاة نفسها. تشمل المقاييس الخمسة التي يمكن ملاحظتها وتقريبها في نموذج FSA: الدقة، والحساسية، واليقين، والنوعية، والاتساق.
مقارنات مع برامج أخرى
تمت مقارنة أداء برنامج FSA مع قواعد بيانات محاذاة متعددة لتسلسلات البروتين (SABmark 1.65 وBAliBASE 3)، والحمض النووي الريبوزي (BRAliBase 2.1 وConsanmix80)، والحمض النووي. أُجريت هذه المقارنات جنبًا إلى جنب مع برامج محاذاة شائعة أخرى مثل ClustalW وMAFFT وMUSCLE وT-Coffee وغيرها. بشكل عام، عند استلام ملخص بحث FSA وورقته البحثية للمراجعة، تفوق أداء FSA على معظم برامج المحاذاة من حيث الدقة والقيمة التنبؤية الإيجابية، بينما كانت حساسيته مماثلة للبرامج الأفضل أداءً مثل MAFFT وProbConsRNA. كما أُجريت مقارنات لأوقات التشغيل من خلال مقارنة أوقات محاذاة تسلسلات الريبوسوم 16S. أنجز برنامج MAFFT المحاذاة بشكل أسرع من برامج المحاذاة الأخرى، بينما كان برنامجا MUSCLE وFSA (باستخدام نموذج ماركوف المخفي ثلاثي الحالات مع تعطيل التحسين التكراري) الأسرع بعده.
مراجع
برادلي آر كيه، روبرتس إيه، سموت إم، جوفيكار إس، دو جيه، ديوي سي، هولمز آي، باتشر إل (2009). "المحاذاة الإحصائية السريعة" . مجلة PLOS لعلم الأحياء الحاسوبي . 5 (5) e1000392. رمز Bibcode : 2009PLSCB...5E0392B . doi : 10.1371/journal.pcbi.1000392 . PMC 2684580. PMID 19478997 .
شوارتز إيه إس، باتشر إل (2007) المحاذاة المتعددة عن طريق تلدين التسلسل. المعلوماتية الحيوية 23: e24-9.
إيدي إس آر. محاذاة متعددة باستخدام نماذج ماركوف المخفية. وقائع المؤتمر الدولي للأنظمة الذكية في البيولوجيا الجزيئية. 1995؛3:114-20. PMID 7584426.
روابط خارجية
- خادم ويب FSA
- شفرة المصدر لهيئة إدارة الغابات
- المعلوماتية الحيوية
