تجميع التسلسل
في المعلوماتية الحيوية ، يشير تجميع التسلسل إلى محاذاة ودمج أجزاء من تسلسل DNA أطول لإعادة بناء التسلسل الأصلي. [ 1 ] هذا ضروري لأن تقنية تسلسل DNA قد لا تتمكن من قراءة الجينومات الكاملة دفعة واحدة، بل تقرأ أجزاءً صغيرة يتراوح طولها بين 20 و30 ألف قاعدة، وذلك حسب التقنية المستخدمة. [ 1 ] عادةً ما تنتج هذه الأجزاء القصيرة (القراءات) من تسلسل الحمض النووي الجينومي بتقنية التسلسل العشوائي ، أو من نسخ الجينات ( ESTs ). [ 1 ]
يمكن تشبيه مشكلة تجميع النصوص بأخذ نسخ متعددة من كتاب، وتمرير كل نسخة منها عبر آلة تمزيق ذات شفرة مختلفة، ثم إعادة تجميع نص الكتاب بمجرد النظر إلى القطع الممزقة. إلى جانب الصعوبة الواضحة لهذه المهمة، توجد بعض المشكلات العملية الإضافية: فقد يحتوي النص الأصلي على فقرات مكررة، وقد تُعدّل بعض القطع الممزقة أثناء التمزيق لتحتوي على أخطاء مطبعية. كما قد تُضاف مقتطفات من كتاب آخر، وقد تصبح بعض القطع الممزقة غير قابلة للتمييز تمامًا.
الأنواع

توجد ثلاث طرق لتجميع بيانات التسلسل:
- De-novo: تجميع قراءات التسلسل لإنشاء تسلسلات كاملة الطول (أحيانًا جديدة)، دون استخدام قالب (انظر مجمعات التسلسل de novo ، تجميع النسخ de novo ) [ 2 ]
- التعيين/المحاذاة: تجميع القراءات عن طريق محاذاتها مع قالب (يُعرف أيضًا باسم المرجع). قد لا يكون التسلسل التوافقي المُجمّع مطابقًا تمامًا للقالب.
- التجميع الموجه بالمرجع: يتم تجميع القراءات حسب تشابهها مع المنطقة الأكثر تشابهًا ضمن المرجع (التخطيط التدريجي). ثم تُقصّر القراءات داخل كل مجموعة لمحاكاة جودة القراءات القصيرة. إحدى الطرق الشائعة للقيام بذلك هي طريقة k-mer . يكون التجميع الموجه بالمرجع أكثر فائدة عند استخدام القراءات الطويلة . [ 3 ]
التجميع الموجه بالمرجع هو مزيج من الأنواع الأخرى. يُطبق هذا النوع على القراءات الطويلة لمحاكاة مزايا القراءات القصيرة (أي جودة القراءة). وتتلخص فكرته في تجميع القراءات في نوافذ أصغر ضمن المرجع. ثم تُقلل أحجام القراءات في كل مجموعة باستخدام خوارزمية k-mer لاختيار التسلسل المتصل (contig) ذي الجودة الأعلى والأكثر احتمالاً. بعد ذلك، تُجمع هذه التسلسلات المتصلة معًا لتكوين هيكل أساسي. ويتم التوصل إلى التوافق النهائي بسد أي فجوات في هذا الهيكل.
التجمعات
الجينوم
بدأت برامج تجميع التسلسلات الأولى بالظهور في أواخر الثمانينيات وأوائل التسعينيات كنسخ معدلة من برامج محاذاة التسلسلات الأبسط ، وذلك لتجميع كميات هائلة من الشظايا الناتجة عن أجهزة التسلسل الآلية المعروفة باسم أجهزة تسلسل الحمض النووي . [ 2 ] ومع ازدياد حجم الكائنات الحية التي تم تسلسلها وتعقيدها (من الفيروسات الصغيرة مرورًا بالبلازميدات وصولًا إلى البكتيريا وأخيرًا حقيقيات النوى )، احتاجت برامج التجميع المستخدمة في مشاريع الجينوم هذه إلى استراتيجيات متطورة بشكل متزايد للتعامل مع ما يلي:
- تيرابايتات من بيانات التسلسل التي تحتاج إلى معالجة على مجموعات الحوسبة ؛
- التسلسلات المتطابقة والمتطابقة تقريبًا (المعروفة باسم التكرارات ) والتي يمكن أن تزيد، في أسوأ الحالات، من تعقيد الوقت والمساحة للخوارزميات بشكل تربيعي؛
- أخطاء قراءة الحمض النووي في الأجزاء من أجهزة التسلسل، والتي يمكن أن تعيق عملية التجميع.
في مواجهة تحدي تجميع أول جينومات حقيقية النواة كبيرة الحجم - ذبابة الفاكهة دروسوفيلا ميلانوغاستر عام 2000، وجينوم الإنسان بعد عام واحد فقط - طور العلماء برامج تجميع مثل سيليرا أسمبلر [ 4 ] وأراخني [ 5 ] ، القادرة على التعامل مع جينومات يتراوح حجمها بين 130 مليون (مثل ذبابة الفاكهة دروسوفيلا ميلانوغاستر ) و3 مليارات (مثل جينوم الإنسان) من أزواج القواعد. وبعد هذه الجهود، قامت عدة مجموعات أخرى، معظمها في مراكز تسلسل الجينوم الرئيسية، ببناء برامج تجميع واسعة النطاق، وانطلق مشروع مفتوح المصدر يُعرف باسم AMOS [ 6 ] لجمع كل الابتكارات في تقنية تجميع الجينوم ضمن إطار عمل مفتوح المصدر .

EST
كان تجميع علامات التسلسل المعبر عنها (EST) استراتيجية مبكرة، تعود إلى منتصف التسعينيات وحتى منتصف العقد الأول من الألفية الثانية، لتجميع الجينات الفردية بدلاً من الجينومات الكاملة. [ 7 ] تختلف هذه العملية عن تجميع الجينوم في عدة جوانب. فالتسلسلات المدخلة لتجميع EST هي أجزاء من الحمض النووي الريبوزي الرسول (mRNA) المنسوخ من الخلية، وتمثل جزءًا فقط من الجينوم الكامل. [ 7 ] كما تختلف العديد من المشكلات الخوارزمية بين تجميع الجينوم وتجميع EST. على سبيل المثال، غالبًا ما تحتوي الجينومات على كميات كبيرة من التسلسلات المتكررة، تتركز في المناطق بين الجينات. بينما تحتوي الجينات المنسوخة على عدد أقل بكثير من التكرارات، مما يجعل التجميع أسهل نوعًا ما. من ناحية أخرى، يتم التعبير عن بعض الجينات (نسخها) بأعداد كبيرة جدًا (مثل جينات الصيانة الخلوية )، مما يعني أنه على عكس تسلسل الجينوم الكامل بتقنية "شوتجن"، لا يتم أخذ عينات القراءات بشكل موحد عبر الجينوم.
تزداد عملية تجميع تسلسلات EST تعقيدًا بسبب خصائص مثل التضفير البديل (cis) ، والتضفير العابر ، وتعدد أشكال النوكليوتيدات المفردة ، والتعديل ما بعد النسخ . ابتداءً من عام 2008، مع ابتكار تقنية RNA-Seq ، استُبدلت تقنية تسلسل EST بهذه التقنية الأكثر كفاءة، والموصوفة تحت عنوان تجميع النسخ من الصفر .
التجميع من الصفر مقابل التجميع باستخدام الخرائط
من حيث التعقيد ومتطلبات الوقت، تُعدّ عمليات تجميع الجينوم من الصفر أبطأ بكثير وأكثر استهلاكًا للذاكرة من عمليات تجميع الجينوم القائمة على الخرائط. ويعود ذلك في الغالب إلى أن خوارزمية التجميع تحتاج إلى مقارنة كل قراءة مع كل قراءة أخرى (وهي عملية ذات تعقيد زمني بسيط يبلغ O( n² ) ). قد تستخدم برامج تجميع الجينوم من الصفر الحالية أنواعًا مختلفة من الخوارزميات القائمة على الرسوم البيانية، مثل: [ 8 ]
- نهج التداخل/التخطيط/التوافق (OLC)، والذي كان نموذجياً لمجمعات بيانات سانجر ويعتمد على رسم بياني للتداخل؛
- نهج رسم بياني دي بروين (DBG)، وهو الأكثر تطبيقًا على نطاق واسع على القراءات القصيرة من منصات Solexa و SOLiD. يعتمد على رسوم بيانية k-mer، والتي تعمل بشكل جيد مع كميات هائلة من القراءات القصيرة؛
- النهج الجشع القائم على الرسم البياني ، والذي قد يستخدم أيضًا أحد نهجي OLC أو DBG. في خوارزميات الرسم البياني الجشعة، تنمو القطع المتجاورة، وهي سلاسل من القراءات المتراصفة معًا، عن طريق التمديد الجشع، حيث تأخذ دائمًا القراءة التي يتم العثور عليها باتباع أعلى درجة تداخل. [ 3 ]
بالإشارة إلى المقارنة التي وردت في المقدمة حول الكتب الممزقة: فبينما يُستخدم كتاب مشابه جدًا كنموذج عند تجميع الخرائط (ربما مع تغيير أسماء الشخصيات الرئيسية وبعض المواقع)، فإن التجميعات الجديدة كليًا تُمثل تحديًا أكبر، إذ لا يمكن معرفة مسبقًا ما إذا كان هذا العمل سيُصبح كتابًا علميًا، أو رواية، أو فهرسًا، أو حتى عدة كتب. كما أن كل قطعة ممزقة ستُقارن بكل قطعة أخرى.
تتطلب معالجة التكرارات في التجميع من الصفر إنشاء رسم بياني يمثل التكرارات المتجاورة. ويمكن استخلاص هذه المعلومات من قراءة جزء طويل يغطي التكرارات بالكامل أو طرفيه فقط . من ناحية أخرى، في تجميع الخرائط، تُترك الأجزاء التي تحتوي على تطابقات متعددة أو لا تحتوي على أي تطابقات عادةً لتقنية تجميع أخرى لفحصها. [ 3 ]
التقدم التكنولوجي
تتحدد صعوبة تجميع التسلسلات بعاملين رئيسيين: عدد القطع وطولها. فبينما تُتيح القطع الأكثر عددًا والأطول تحديدًا أفضل لتداخلات التسلسلات، فإنها تُسبب أيضًا مشاكل، إذ تُظهر الخوارزميات الأساسية تعقيدًا تربيعيًا أو حتى أُسّيًا بالنسبة لعدد القطع وطولها. وعلى الرغم من أن التسلسلات الأقصر أسرع في المحاذاة، إلا أنها تُعقّد مرحلة التخطيط في عملية التجميع، لأن القراءات الأقصر يصعب استخدامها مع التكرارات أو التكرارات المتطابقة تقريبًا.
في بدايات علم تسلسل الحمض النووي، لم يكن بإمكان العلماء الحصول إلا على بضعة تسلسلات قصيرة (حوالي اثنتي عشرة قاعدة) بعد أسابيع من العمل في المختبرات. ولذلك، كان من الممكن محاذاة هذه التسلسلات يدويًا في غضون دقائق معدودة.
في عام 1975، تم اختراع طريقة إنهاء ثنائي ديوكسي (المعروفة أيضًا باسم تسلسل سانجر )، وحتى ما بعد عام 2000 بقليل، تم تطوير هذه التقنية إلى درجة مكّنت الآلات المؤتمتة بالكامل من إنتاج التسلسلات بشكل متوازٍ للغاية على مدار 24 ساعة في اليوم. وقد ضمت مراكز الجينوم الكبيرة حول العالم مزارع كاملة من هذه الآلات، مما أدى بدوره إلى ضرورة تحسين برامج التجميع لتسلسلات مشاريع تسلسل الجينوم الكامل بتقنية "شوتجن"، حيث تكون القراءات...
- يبلغ طولها حوالي 800-900 قاعدة
- تحتوي على شوائب التسلسل مثل نواقل التسلسل والاستنساخ
- تتراوح معدلات الخطأ بين 0.5 و 10%
بفضل تقنية سانجر، أصبح من الممكن تجميع مشاريع البكتيريا التي تتراوح قراءاتها بين 20,000 و200,000 قراءة بسهولة على جهاز كمبيوتر واحد. أما المشاريع الأكبر، مثل مشروع الجينوم البشري الذي يحتوي على حوالي 35 مليون قراءة، فكانت تتطلب مزارع حاسوبية ضخمة وحوسبة موزعة.
بحلول عامي 2004/2005، أصبحت تقنية التسلسل الناري قابلة للتطبيق تجاريًا بفضل شركة 454 Life Sciences . [ 9 ] أنتجت هذه الطريقة الجديدة للتسلسل قراءات أقصر بكثير من تلك التي تنتجها تقنية سانجر: حوالي 100 قاعدة في البداية، وأصبحت الآن تتراوح بين 400 و500 قاعدة. [ 9 ] وقد شجعت إنتاجيتها العالية وتكلفتها المنخفضة (مقارنةً بتقنية سانجر) مراكز الجينوم على تبني هذه التقنية، مما دفع بدوره إلى تطوير برامج تجميع التسلسلات القادرة على التعامل بكفاءة مع مجموعات القراءات. إلا أن الكم الهائل من البيانات، بالإضافة إلى أنماط الأخطاء الخاصة بكل تقنية في القراءات، أدى إلى تأخير تطوير برامج التجميع؛ ففي بداية عام 2004، لم يكن متاحًا سوى برنامج التجميع Newbler من شركة 454. وفي منتصف عام 2007، أصدر شيفركس وزملاؤه النسخة الهجينة من برنامج التجميع MIRA. [ 10 ] كان أول برنامج تجميع متاح مجانًا قادر على تجميع قراءات 454 بالإضافة إلى مزيج من قراءات 454 وقراءات سانجر. وقد أُطلق على تجميع التسلسلات من تقنيات تسلسل مختلفة لاحقًا اسم التجميع الهجين . [ 10 ]
منذ عام 2006، أصبحت تقنية Illumina (المعروفة سابقًا باسم Solexa) متاحة، وهي قادرة على توليد حوالي 100 مليون قراءة لكل عملية تشغيل على جهاز تسلسل واحد. قارن هذا بـ 35 مليون قراءة لمشروع الجينوم البشري، والذي استغرق إنتاجه عدة سنوات على مئات من أجهزة التسلسل. [ 11 ] كانت تقنية Illumina في البداية محدودة بطول 36 قاعدة فقط، مما جعلها أقل ملاءمة للتجميع من الصفر (مثل تجميع النسخ الجيني من الصفر )، ولكن الإصدارات الأحدث من هذه التقنية حققت أطوال قراءة تتجاوز 100 قاعدة من طرفي نسخة مستنسخة يتراوح طولها بين 300 و400 زوج قاعدي. [ 11 ] أُعلن في نهاية عام 2007 عن برنامج التجميع SHARCGS [ 12 ] من قِبل Dohm وآخرون، وكان أول برنامج تجميع منشور يُستخدم للتجميع باستخدام قراءات Solexa. وسرعان ما تبعه عدد من البرامج الأخرى.
لاحقًا، ظهرت تقنيات جديدة مثل SOLiD من شركة Applied Biosystems ، وIon Torrent ، و SMRT ، واستمر ظهور تقنيات جديدة (مثل تسلسل Nanopore ). على الرغم من ارتفاع معدلات الخطأ في هذه التقنيات، إلا أنها مهمة في عملية التجميع لأن طول القراءة الأطول يساعد في معالجة مشكلة التكرار. [ 11 ] من المستحيل التجميع من خلال تكرار مثالي أطول من الحد الأقصى لطول القراءة؛ ومع ذلك، كلما زاد طول القراءات، قلّ احتمال وجود تكرار مثالي بهذا الطول. وهذا يمنح قراءات التسلسل الأطول ميزة في تجميع التكرارات حتى لو كانت دقتها منخفضة (حوالي 85%). [ 11 ]
ضبط الجودة
تتضمن معظم برامج تجميع التسلسلات خوارزميات مدمجة لمراقبة الجودة، مثل Phred . [ 13 ] ومع ذلك، لا تقيّم هذه المقاييس اكتمال التجميع من حيث محتوى الجينات. بعض الأدوات تقيّم جودة التجميع بعد اكتماله.
على سبيل المثال، يُعدّ BUSCO (معيار قياس الجينات المتماثلة أحادية النسخة العالمية) مقياسًا لاكتمال الجينات في الجينوم أو مجموعة الجينات أو النسخ الجيني ، وذلك بالاعتماد على حقيقة أن العديد من الجينات موجودة فقط كجينات أحادية النسخة في معظم الجينومات. [ 14 ] مثّلت مجموعات BUSCO الأولية 3023 جينًا للفقاريات ، و2675 للمفصليات ، و843 للحيوانات متعددة الخلايا ، و1438 للفطريات، و429 لحقيقيات النوى . يوضح هذا الجدول مثالًا لجينوم الإنسان وذبابة الفاكهة: [ 14 ]
| صِنف | الجينات | مكتمل | مكرر | مجزأ | مفتقد | ن (رقم جين BUSCO) |
|---|---|---|---|---|---|---|
| الإنسان العاقل | 20364 | 99 | 1.7 | 0.0 | 0.0 | 3023 |
| ذبابة الفاكهة (دروسوفيلا ميلانوجاستر) | 13918 | 99 | 3.7 | 0.2 | 0.0 | 2675 |
خوارزميات التجميع
تحتوي جينومات الكائنات الحية المختلفة على مناطق مميزة ذات تعقيد أعلى، مما يستدعي استخدام مناهج حسابية متنوعة. ومن بين الخوارزميات الشائعة الاستخدام:
- تجميع الرسوم البيانية
- يعتمد هذا النهج على نظرية الرسوم البيانية في علوم الحاسوب. يُعدّ رسم دي بروين البياني مثالاً على هذا النهج، حيث يستخدم وحدات k-mers لتجميع تسلسل متصل (contig) من القراءات. [ 15 ]
- تجميع الرسم البياني الجشع
- يقوم هذا النهج بتقييم كل قراءة مضافة إلى التجميع ويختار أعلى درجة ممكنة من المنطقة المتداخلة.
- بالنظر إلى مجموعة من أجزاء التسلسل، فإن الهدف هو إيجاد تسلسل أطول يحتوي على جميع الأجزاء (انظر الشكل تحت أنواع تجميع التسلسل ):
- احسب محاذاة الأزواج لجميع الأجزاء.
- اختر جزأين متداخلين بشكل كبير.
- دمج الأجزاء المختارة.
- كرر الخطوتين 2 و 3 حتى يتبقى جزء واحد فقط.
- قد لا تكون النتيجة حلاً مثالياً للمشكلة.
خط أنابيب المعلوماتية الحيوية
بشكل عام، هناك ثلاث خطوات في تجميع قراءات التسلسل في هيكل:
- التجميع المسبق: تُعد هذه الخطوة أساسية لضمان سلامة التحليلات اللاحقة، مثل تحديد المتغيرات أو تسلسل السقالة النهائي. تتكون هذه الخطوة من مسارين زمنيين:
- فحص الجودة: اعتمادًا على نوع تقنية التسلسل، قد تظهر أخطاء مختلفة تؤدي إلى قراءة خاطئة للقاعدة . على سبيل المثال، قد يُقرأ تسلسل "NAAAAAAAAAAAAN" و"NAAAAAAAAAAAAN" اللذين يحتويان على 12 قاعدة أدينين بشكل خاطئ على أنهما يحتويان على 11 قاعدة أدينين. كما أن تسلسل جزء متكرر للغاية من الحمض النووي المستهدف (DNA/RNA) قد ينتج عنه قراءة أقصر أو أطول بقاعدة واحدة. تُقاس جودة القراءة عادةً باستخدام درجات جودة Phred، وهي عبارة عن درجة مُشفّرة لجودة كل نيوكليوتيد ضمن تسلسل القراءة.
- تصفية القراءات: يجب إزالة القراءات التي فشلت في اجتياز فحص الجودة من ملف FASTQ للحصول على أفضل تجميعات متجاورة.
- التجميع: خلال هذه الخطوة، يُستخدم محاذاة القراءات بمعايير مختلفة لتحديد موقع كل قراءة. يعتمد الموقع المتوقع للقراءة على مدى تطابق تسلسلها مع قراءات أخرى أو مع قراءة مرجعية. تُستخدم خوارزميات محاذاة مختلفة للقراءات من تقنيات التسلسل المختلفة. من بين الأساليب الشائعة في التجميع: مخطط دي بروين والتداخل. يلعب طول القراءة وتغطيتها وجودتها وتقنية التسلسل المستخدمة دورًا رئيسيًا في اختيار أفضل خوارزمية محاذاة في حالة تسلسل الجيل التالي . [ 16 ] من ناحية أخرى، تتطلب خوارزميات محاذاة قراءات تسلسل الجيل الثالث أساليب متقدمة لمراعاة معدل الخطأ العالي المرتبط بها.
- مرحلة ما بعد التجميع: تركز هذه المرحلة على استخلاص معلومات قيّمة من التسلسل المُجمّع. يُعدّ علم الجينوم المقارن وتحليل التجمعات السكانية مثالين على تحليل ما بعد التجميع.
البرامج
للاطلاع على قائمة ببرامج تجميع التسلسلات من الصفر ، انظر قسم برامج تجميع التسلسلات من الصفر . وللاطلاع على قائمة ببرامج محاذاة التسلسلات، انظر قسم قائمة برامج محاذاة التسلسلات § محاذاة تسلسلات القراءة القصيرة .
بعض الأدوات الشائعة المستخدمة في خطوات التجميع المختلفة مدرجة في الجدول التالي:
| برمجة | نوع القراءة | صفحة ويب للأداة | ملحوظات |
|---|---|---|---|
| FastQC | عديد | https://www.bioinformatics.babraham.ac.uk/projects/fastqc/ | هذه أداة شائعة تستخدم للتحقق من جودة القراءات من تقنيات التسلسل المختلفة مثل Illumina و 454 و PacBio . |
| BWA | قراءات قصيرة وطويلة | https://sourceforge.net/projects/bio-bwa/files/ | هذه أداة سطر أوامر . تشتهر في الغالب بتشغيلها الخفيف ومحاذاة التسلسل الدقيقة. |
| الخريطة المصغرة 2 | مقالات طويلة | https://github.com/lh3/minimap2 | تم تصميم أداة سطر الأوامر هذه للتعامل مع PacBio و Oxford Nanopore وتقرأ بمعدل خطأ 15٪. |
| bwa-mem2 | قراءات قصيرة وطويلة | https://github.com/bwa-mem2/bwa-mem2 | تُعد أداة سطر الأوامر هذه تطويرًا مُحسَّنًا للأداء، وبديلًا مباشرًا لبرنامج BWA. [ 17 ] |
| bwa-meme | قراءات قصيرة وطويلة | https://github.com/kaist-ina/BWA-MEME | تُعد أداة سطر الأوامر هذه تطويرًا مُحسَّنًا للأداء، وبديلًا مباشرًا لخوارزمية bwa-mem2 باستخدام التعلم الآلي. [ 18 ] |
| لوريتا | مقالات طويلة | https://github.com/salvocamiolo/LoReTTA/releases/tag/v0.1 | تم تصميم هذه الأداة لتجميع الجينومات الفيروسية (الموجهة بالمرجع) بدقة أكبر باستخدام قراءات PacBio CCS. |
| البستوني | قراءات قصيرة وطويلة | http://cab.spbu.ru/software/spades/ مؤرشف بتاريخ 8 سبتمبر 2020 في أرشيف الإنترنت (Wayback Machine) | هذه أداة تجميع تعمل على سطر الأوامر. |
| سامتولز | تحليل المحاذاة | https://samtools.github.io | يُعد هذا مفيدًا بعد التجميع. إذ يمكنه توليد إحصائيات مختلفة وإجراء خطوات تصفية متعددة لملف المحاذاة. |
انظر أيضاً
مراجع
- 1 2 3 سون جي آي، نام جي دبليو (يناير 2018). "حاضر ومستقبل تجميع الجينوم الكامل من الصفر". موجزات في المعلوماتية الحيوية . 19 (1): 23-40 . doi : 10.1093/bib/bbw096 . PMID 27742661 .
- 1 2 بيكر م (27 مارس 2012). "تجميع الجينوم من الصفر: ما يجب على كل عالم أحياء معرفته" . نيتشر ميثودز . 9 (4): 333-337 . doi : 10.1038/nmeth.1935 . ISSN 1548-7105 .
- 1 2 3 وولف ب. "تجميع الجينوم من الصفر مقابل رسم الخرائط على جينوم مرجعي" (ملف PDF) . جامعة العلوم التطبيقية، غرب سويسرا . تم الاطلاع عليه في 6 أبريل 2019 .
- ↑ مايرز إي دبليو، ساتون جي جي، ديلشر إيه إل، ديو آي إم، فاسولو دي بي، فلانيجان إم جي، وآخرون (مارس 2000). " تجميع كامل لجينوم ذبابة الفاكهة". مجلة ساينس . 287 (5461): 2196-2204 . رمز Bibcode : 2000Sci...287.2196M . CiteSeerX 10.1.1.79.9822 . doi : 10.1126/science.287.5461.2196 . PMID 10731133. S2CID 6049420 .
- ↑ باتزوغلو إس، جافي دي بي، ستانلي كيه، بتلر جيه، جنير إس، ماوسيلي إي، وآخرون . (يناير 2002). "أراكن: مُجمِّع جينوم كامل بتقنية التجزئة العشوائية" . أبحاث الجينوم . 12 (1): 177-189 . doi : 10.1101/gr.208902 . PMC 155255. PMID 11779843 .
- ↑ "AMOS WIKI" . amos.sourceforge.net . تم الاطلاع عليه بتاريخ 2023-01-02 .
- 1 2 ناجاراج إس إتش، جاسر آر بي، رانغاناثان إس (يناير 2007). "دليل مبسط لتحليل علامات التسلسل المعبر عنها (EST)". موجزات في المعلوماتية الحيوية . 8 (1): 6-21 . doi : 10.1093/bib/bbl015 . PMID 16772268 .
- ↑ لي ز، تشين ي، مو د، يوان ج، شي ي، تشانغ هـ، وآخرون (يناير 2012). "مقارنة بين الفئتين الرئيسيتين لخوارزميات التجميع: خوارزمية التداخل والتخطيط والتوافق، وخوارزمية دي بروين للرسم البياني". موجزات في علم الجينوم الوظيفي . 11 (1): 25-37 . doi : 10.1093/bfgp/elr035 . PMID 22184334 .
- هارينغتون سي تي، لين إي آي، أولسون إم تي، إيشلمان جيه آر (سبتمبر 2013). "أساسيات التسلسل الناري". أرشيف علم الأمراض وطب المختبرات . 137 (9): 1296-1303 . doi : 10.5858 /arpa.2012-0463-RA . PMID 23991743 .
- 1 2 "MIRA 2.9.8 لـ 454 و 454 / Sanger hybrid assembly" . groups.google.com . تم الاطلاع عليه بتاريخ 2023-01-02 .
- ١ ٢ ٣ ٤ هو تي، تشيتنيس إن، مونوس دي، دينه إيه (نوفمبر ٢٠٢١). "تقنيات التسلسل الجيني من الجيل التالي: نظرة عامة". علم المناعة البشرية . التسلسل الجيني من الجيل التالي وتطبيقاته في علم المناعة المختبرية الطبية. ٨٢ (١١): ٨٠١-٨١١ . doi : 10.1016/j.humimm.2021.02.012 . PMID 33745759 .
- ↑ دوم جيه سي، لوتاز سي، بورودينا تي، هيملباور إتش (نوفمبر 2007). "SHARCGS، خوارزمية تجميع قراءات قصيرة سريعة ودقيقة للغاية لتسلسل الجينوم من الصفر" . أبحاث الجينوم . 17 (11): 1697-1706 . doi : 10.1101/gr.6435207 . PMC 2045152. PMID 17908823 .
- ↑ كوك، بي. جيه.، فيلدز، سي. جيه.، غوتو، إن.، هوير، إم. إل.، رايس، بي. إم. (أبريل 2010). "صيغة ملف سانجر FASTQ للتسلسلات ذات درجات الجودة، ومتغيرات Solexa/Illumina FASTQ" . مجلة أبحاث الأحماض النووية . 38 (6): 1767-1771 . doi : 10.1093 / nar/gkp1137 . PMC 2847217. PMID 20015970 .
- 1 2 سيمو، ف. أ.، ووترهاوس، ر. م.، إيوانيديس، ب.، كريفنتسيفا، إ. ف.، زدوبنوف، إ. م. (أكتوبر 2015). "BUSCO: تقييم اكتمال تجميع الجينوم وشرحه باستخدام الجينات المتماثلة أحادية النسخة". المعلوماتية الحيوية . 31 (19): 3210-3212 . doi : 10.1093/bioinformatics/btv351 . PMID 26059717 .
- ↑ كومبو، بي. إي.، بيفزنر ، بي. إيه.، تيسلر، جي. (نوفمبر 2011). "كيفية تطبيق رسوم بيانية دي بروين على تجميع الجينوم" . مجلة نيتشر للتكنولوجيا الحيوية . 29 (11): 987-991 . doi : 10.1038/nbt.2023 . PMC 5531759. PMID 22068540 .
- ↑ روفالو م، لافرامبواز ت، كويوتورك م (أكتوبر 2011). "تحليل مقارن لخوارزميات محاذاة قراءات التسلسل من الجيل التالي" . المعلوماتية الحيوية . 27 (20): 2790-2796 . doi : 10.1093/bioinformatics/btr477 . PMID 21856737 .
- ↑ فاسيم الدين م، ميسرا س، لي هـ، ألورو س (مايو 2019). "تسريع فعال لتقنية BWA-MEM مع مراعاة بنية المعالج لأنظمة متعددة النوى". ندوة IEEE الدولية للمعالجة المتوازية والموزعة (IPDPS) لعام 2019. IEEE. ص 314-324 . arXiv : 1907.12931 . doi : 10.1109/IPDPS.2019.00041 . ISBN 978-1-7281-1246-6.
- ↑ جونغ ي، هان د (2022-03-07). "BWA-MEME: محاكاة BWA-MEM باستخدام أسلوب التعلم الآلي" . المعلوماتية الحيوية . 38 (9): 2404-2413 . doi : 10.1093/bioinformatics/btac137 . ISSN 1367-4803 . PMID 35253835 .
- المعلوماتية الحيوية
- طرق تسلسل الحمض النووي
