تجميع التسلسل
في المعلوماتية الحيوية ، تسعى خوارزميات تجميع التسلسلات إلى تجميع التسلسلات البيولوجية ذات الصلة. قد تكون هذه التسلسلات جينومية ، أو نسخية ( ESTs )، أو بروتينية . بالنسبة للبروتينات، تُجمّع التسلسلات المتماثلة عادةً في عائلات . أما بالنسبة لبيانات ESTs، فيُعدّ التجميع مهمًا لتجميع التسلسلات المنحدرة من نفس الجين قبل تجميع ESTs لإعادة بناء mRNA الأصلي .
تستخدم بعض خوارزميات التجميع التجميع أحادي الارتباط ، حيث تُنشئ إغلاقًا متعديًا للتسلسلات ذات التشابه الذي يتجاوز عتبة معينة. يستخدم كل من UCLUST [ 1 ] وCD-HIT [ 2 ] خوارزمية جشعة تُحدد تسلسلًا ممثلًا لكل مجموعة، وتُعين تسلسلًا جديدًا لتلك المجموعة إذا كان مشابهًا بدرجة كافية للتسلسل الممثل؛ أما إذا لم يُطابق التسلسل، فإنه يُصبح التسلسل الممثل لمجموعة جديدة. غالبًا ما تعتمد درجة التشابه على محاذاة التسلسلات . يُستخدم تجميع التسلسلات عادةً لإنشاء مجموعة غير متكررة من التسلسلات الممثلة .
غالباً ما تكون تجمعات التسلسل مرادفة (ولكنها ليست مطابقة) لعائلات البروتينات . ويهدف العديد من مبادرات علم الجينوم البنيوي إلى تحديد بنية ثلاثية نموذجية لكل تجمع تسلسل .
خوارزميات وحزم تجميع التسلسلات
- CD-HIT [ 2 ]
- UCLUST في USEARCH [ 1 ]
- Starcode: [ 3 ] خوارزمية سريعة لتجميع التسلسلات تعتمد على البحث الدقيق عن جميع الأزواج. [ 4 ]
- OrthoFinder: [ 5 ] طريقة سريعة وقابلة للتطوير ودقيقة لتجميع البروتينات في عائلات جينية (مجموعات متماثلة) [ 6 ] [ 7 ]
- Linclust: [ 8 ] أول خوارزمية يتناسب وقت تشغيلها خطيًا مع حجم مجموعة المدخلات، وهي سريعة جدًا، وجزء من مجموعة برامج MMseqs2 [ 9 ] للبحث السريع والحساس عن التسلسلات وتجميع مجموعات التسلسلات الكبيرة
- TribeMCL: طريقة لتجميع البروتينات في مجموعات ذات صلة [ 10 ]
- BAG: خوارزمية تجميع التسلسلات القائمة على نظرية الرسم البياني [ 11 ]
- JESAM: [ 12 ] محرك محاذاة الحمض النووي مفتوح المصدر وقابل للتوسع بالتوازي مع مكون برمجي اختياري للتجميع
- UICluster: [ 13 ] التجميع المتوازي لتسلسلات EST (الجينات)
- BLASTClust التجميع أحادي الارتباط باستخدام BLAST [ 14 ]
- برنامج التجميع: [ 15 ] تطبيق جافا قابل للتوسيع لتجميع التسلسلات وتحليلات التجميع
- PATDB: برنامج لتحديد السلاسل الفرعية المثالية بسرعة
- nrdb: [ 16 ] برنامج لدمج التسلسلات المتكررة (المتطابقة) بشكل تافه
- CluSTr: [ 17 ] قاعدة بيانات لتجميع تسلسلات البروتينات ذات الارتباط الأحادي، تعتمد على تشابهات تسلسلات سميث-واترمان؛ وتغطي أكثر من 7 ملايين تسلسل، بما في ذلك UniProt وIPI
- ICAtools [ 18 ] - حزمة تجميع الحمض النووي الأصلية (القديمة) مع العديد من الخوارزميات المفيدة لاكتشاف القطع الأثرية أو تجميع EST
- أداة Skipredudant EMBOSS [ 19 ] لإزالة التسلسلات الزائدة من مجموعة
- خوارزمية CLUSS [ 20 ] لتحديد مجموعات من تسلسلات البروتينات التي يصعب محاذاتها، والتي ترتبط بنيويًا أو وظيفيًا أو تطوريًا. خادم ويب CLUSS [ 21 ]
- خوارزمية CLUSS2 [ 22 ] لتجميع عائلات تسلسلات البروتينات التي يصعب محاذاتها والتي لها وظائف بيولوجية متعددة. خادم ويب CLUSS2 [ 21 ]
قواعد بيانات التسلسل غير المتكررة
- PISCES: خادم لتنقية تسلسل البروتين [ 23 ]
- RDB90 [ 24 ]
- UniRef: قاعدة بيانات تسلسل UniProt غير المتكررة [ 25 ]
- Uniclust: تسلسلات UniProtKB مجمعة عند مستوى تطابق تسلسل الأزواج بنسبة 90% و50% و30%. [ 26 ]
- مجموعات الجينات المتماثلة للفيروسات: [ 27 ] قاعدة بيانات لتجميع تسلسلات البروتينات الفيروسية؛ تحتوي على جميع الجينات المتوقعة من إحدى عشرة عائلة فيروسية، مُنظمة في مجموعات متماثلة حسب تشابه BLASTP
انظر أيضاً
مراجع
- 1 2 "USEARCH" . drive5.com .
- 1 2 "CD-HIT: طريقة فائقة السرعة لتجميع تسلسلات البروتين والنيوكليوتيدات، مع العديد من التطبيقات الجديدة في بيانات التسلسل من الجيل التالي (NGS)" . cd-hit.org .
- ↑ "مستودع Starcode" . GitHub . 2018-10-11.
- ^ زوريتا إي، كوسكو بي، فيليون جي جي (يونيو 2015). "رمز النجمة: التجميع التسلسلي بناءً على البحث عن جميع الأزواج" . المعلوماتية الحيوية . 31 (12): 1913–9 . دوى : 10.1093/المعلوماتية الحيوية/btv053 . بمك 4765884 . بميد 25638815 .
- ↑ "OrthoFinder" . مختبر ستيف كيلي .
- ↑ إيمز دي إم، كيلي إس (أغسطس 2015). " أورثوفايندر: حل التحيزات الأساسية في مقارنات الجينوم الكامل يحسن بشكل كبير دقة استنتاج مجموعات الأورثو" . علم الأحياء الجينومي . 16 (1) 157. doi : 10.1186/s13059-015-0721-2 . PMC 4531804. PMID 26243257 .
- ↑ إيمز دي إم، كيلي إس (نوفمبر 2019). "أورثوفايندر: استدلال التماثل الوراثي لعلم الجينوم المقارن" . علم الأحياء الجينومي . 20 (1) 238. doi : 10.1186/s13059-019-1832-y . PMC 6857279. PMID 31727128 .
- ↑ شتاينغر م، سودينغ ج (يونيو 2018). "تجميع مجموعات تسلسل البروتين الضخمة في وقت خطي" . نيتشر كوميونيكيشنز . 9 (1) 2542. Bibcode : 2018NatCo...9.2542S . doi : 10.1038/ s41467-018-04964-5 . PMC 6026198. PMID 29959318 .
- ↑ شتاينغر م، سودينغ ج (نوفمبر 2017). "يُمكّن برنامج MMseqs2 من البحث الحساس عن تسلسل البروتين لتحليل مجموعات البيانات الضخمة". مجلة Nature Biotechnology . 35 (11): 1026-1028 . doi : 10.1038/nbt.3988 . hdl : 11858/00-001M-0000-002E-1967-3 . PMID 29035372. S2CID 402352 .
- ↑ إنرايت إيه جيه، فان دونجن إس، أوزونيس سي إيه (أبريل 2002). "خوارزمية فعالة للكشف واسع النطاق عن عائلات البروتينات" . مجلة أبحاث الأحماض النووية . 30 (7): 1575-1584 . doi : 10.1093 / nar/30.7.1575 . PMC 101833. PMID 11917018 .
- ↑ "نسخة مؤرشفة" . مؤرشفة من الأصل بتاريخ 2003-12-06 . تم الاطلاع عليها بتاريخ 2004-02-19 .
{{cite web}}: CS1 maint: archived copy as title ( link ) - ↑ "ورقة بحثية في المعلوماتية الحيوية: JESAM: مكونات برمجية CORBA لمحاذاة وتجميع تسلسلات EST" . littlest.co.uk .
- ↑ "pedretti@eyeball -- صفحة التجميع" . ratest.eng.uiowa.edu . مؤرشف من الأصل بتاريخ 2005-04-09.
- ↑ "أخبار المركز الوطني لمعلومات التقانة الحيوية: ربيع 2004 - مختبر BLAST" . nih.gov .
- ↑ "Clusterer: تطبيق جافا قابل للتوسيع لتجميع التسلسلات وتحليلات التجميع" . bugaco.com .
- ↑ "فهرس /pub/nrdb" . مؤرشف من الأصل بتاريخ 2008-01-01.
- ↑ "CluSTr" . مؤرشف من الأصل بتاريخ 24-09-2006 . تم الاطلاع عليه بتاريخ 23-11-2006 .
- ↑ "مقدمة إلى أدوات ICA" . littlest.co.uk .
- ^ "النقش: تخطي زائد عن الحاجة" . باستور .fr .
- ↑ كيليل أ، وانغ س، برزيزينسكي ر، فلوري أ (أغسطس 2007). " CLUSS: تجميع تسلسلات البروتين بناءً على مقياس تشابه جديد" . BMC Bioinformatics . 8 286. doi : 10.1186/1471-2105-8-286 . PMC 1976428. PMID 17683581 .
- 1 2 "الصفحة الرئيسية لـ CLUSS" .
- ↑ كيليل أ، وانغ س، برزيزينسكي ر (2008). "CLUSS2: خوارزمية مستقلة عن المحاذاة لتجميع عائلات البروتينات ذات الوظائف البيولوجية المتعددة". المجلة الدولية لعلم الأحياء الحاسوبي وتصميم الأدوية . 1 (2): 122-140 . doi : 10.1504/ijcbdd.2008.020190 . PMID 20058485 .
- ↑ "مختبر دنبراك" . fccc.edu .
- ↑ هولم إل، ساندر سي (يونيو 1998). "إزالة التكرار بين التسلسلات المجاورة من مجموعات تسلسل البروتين الكبيرة" . المعلوماتية الحيوية . 14 (5): 423-429 . doi : 10.1093/bioinformatics/14.5.423 . PMID 9682055 .
- ↑ "حول UniProt" . uniprot.org .
- ↑ ميرديتا م، فون دين دريش ل، غالييز س، مارتن م ج، سودينغ ج، شتاينغر م (يناير 2017). " قواعد بيانات يونيكلاست لتسلسلات البروتينات المجمعة والمُعَلَّمة بعمق ومحاذاتها" . مجلة أبحاث الأحماض النووية . 45 (D1): D170– D176. doi : 10.1093/nar/gkw1081 . PMC 5614098. PMID 27899574 .
- ↑ " مركز موارد المعلوماتية الحيوية الفيروسية - VOCS" . uvic.ca.
- المعلوماتية الحيوية
