تنسيق FASTQ
يُعدّ تنسيق FASTQ تنسيقًا نصيًا لتخزين كلٍّ من التسلسل البيولوجي (عادةً تسلسل النيوكليوتيدات ) ودرجات جودته. ويتم ترميز كلٍّ من حرف التسلسل ودرجة الجودة بحرف ASCII واحد للاختصار.
تم تطويره في الأصل في معهد ويلكوم ترست سانجر لتجميع تسلسل بتنسيق FASTA وبيانات الجودة الخاصة به، ولكنه أصبح المعيار الفعلي لتخزين مخرجات أجهزة التسلسل عالية الإنتاجية مثل محلل جينوم Illumina . [ 1 ]
شكل
يحتوي ملف FASTQ على أربعة حقول مفصولة بأسطر لكل تسلسل:
- يبدأ الحقل 1 بحرف '@' ويتبعه معرف تسلسلي ووصف اختياري (مثل سطر عنوان FASTA ).
- الحقل الثاني هو الأحرف المتسلسلة الخام.
- يبدأ الحقل 3 بحرف "+" ويمكن أن يتبعه بشكل اختياري نفس معرف التسلسل (وأي وصف) مرة أخرى.
- يقوم الحقل 4 بتشفير قيم الجودة للتسلسل في الحقل 2، ويجب أن يحتوي على نفس عدد الرموز مثل الأحرف في التسلسل.
قد يبدو ملف FASTQ الذي يحتوي على تسلسل واحد على النحو التالي:
@SEQ_ID جاتتججتتكااجكاجتاتجاتكااتاجتااتككاتتجتكاكاكتاكاجتت + !''*((((***+))%%%++)(%%%%).1***-+*''))**55CCF>>>>>>CCCCCCC65
يتراوح البايت الذي يمثل الجودة من 0x21 (أدنى جودة؛ '!' في نظام ASCII) إلى 0x7e (أعلى جودة؛ '~' في نظام ASCII). فيما يلي رموز قيم الجودة مرتبة تصاعديًا من اليسار إلى اليمين ( ASCII ):
!"#$%&'()*+,-./0123456789:;<=>?@ABCDEFGHIJKLMNOPQRSTUVWXYZ[\]^_`abcdefghijklmnopqrstuvwxyz{|}~ كانت ملفات FASTQ الأصلية من سانجر تقسم التسلسلات الطويلة وسلاسل الجودة على عدة أسطر، كما هو معتاد في ملفات FASTA . يُعقّد هذا الأمر عملية التحليل نظرًا لاختيار الرمزين "@" و"+" كعلامات (إذ يمكن أن يظهر هذان الرمزان أيضًا في سلسلة الجودة). أصبحت ملفات FASTQ متعددة الأسطر (وبالتالي برامج تحليلها) أقل شيوعًا الآن، نظرًا لأن غالبية عمليات التسلسل تتم باستخدام تقنية Illumina للتسلسل قصير القراءة ، بأطوال تسلسل نموذجية تبلغ حوالي 100 زوج قاعدي.
معرّفات تسلسل Illumina
تستخدم التسلسلات من برنامج Illumina مُعرّفًا منهجيًا:
@HWUSI-EAS100R : 6 : 73 : 941 : 1973 #0/1| HWUSI-EAS100R | اسم الآلة الفريد |
|---|---|
| 6 | مسار خلية التدفق |
| 73 | رقم البلاطة داخل مسار خلية التدفق |
| 941 | إحداثي س للمجموعة داخل البلاطة |
| 1973 | إحداثي 'y' للمجموعة داخل البلاطة |
| 10 | رقم الفهرس لعينة متعددة الإرسال (0 لعدم وجود فهرسة) |
| /1 | العضو في الزوج، /1 أو /2 (قراءات الطرف المزدوج أو الزوج المتزاوج فقط) |
يبدو أن إصدارات خط أنابيب Illumina منذ الإصدار 1.4 تستخدم #NNNNNN بدلاً من #0 لمعرف الإرسال المتعدد، حيث NNNNNN هو تسلسل علامة الإرسال المتعدد.
مع إصدار Casava 1.8، تغير تنسيق سطر "@":
@EAS139 : 136 : FC706VJ : 2 : 2104 : 15343 : 197393 1 : Y : 18 : ATCACG | EAS139 | اسم الآلة الفريد |
|---|---|
| 136 | معرّف التشغيل |
| FC706VJ | معرف خلية التدفق |
| 2 | مسار خلية التدفق |
| 2104 | رقم البلاطة داخل مسار خلية التدفق |
| 15343 | إحداثي س للمجموعة داخل البلاطة |
| 197393 | إحداثي 'y' للمجموعة داخل البلاطة |
| 1 | العضو من الزوج، 1 أو 2 (قراءات الطرف المزدوج أو الزوج المتزاوج فقط) |
| Y | Y إذا تم ترشيح القراءة (لم تجتاز الفحص)، N خلاف ذلك |
| 18 | تكون القيمة صفرًا عندما لا تكون أي من بتات التحكم قيد التشغيل، وإلا فهي عدد زوجي. |
| ATCACG | تسلسل الفهرس |
لاحظ أن الإصدارات الأحدث من برنامج Illumina تُخرج رقم عينة (يُحدد بترتيب العينات في ورقة العينات) بدلاً من تسلسل الفهرسة عندما لا يتم تحديد تسلسل فهرسة صريح لعينة ما في ورقة العينات. على سبيل المثال، قد يظهر العنوان التالي في ملف FASTQ الخاص بالعينة الأولى من مجموعة عينات:
@EAS139 : 136 : FC706VJ : 2 : 2104 : 15343 : 197393 1 : ن : 18 : 1أرشيف قراءات التسلسل التابع للمركز الوطني لمعلومات التقانة الحيوية (NCBI)
غالبًا ما تتضمن ملفات FASTQ من أرشيف قراءة التسلسل INSDC وصفًا، على سبيل المثال
@SRR001666.1 071112_SLXA-EAS1_s_7 : 5 : 1 : 817 : 345 الطول = 36 GGGTGATGGCCGCTGCCGATGGCGTCAAATCCCACC +SRR001666.1 071112_SLXA-EAS1_s_7 : 5 : 1 : 817 : 345 الطول = 36 IIIIIIIIIIIIIIIIIIIIIIIIIIIIII9IG9IC في هذا المثال، يوجد مُعرِّف مُخصَّص من NCBI، ويحتوي الوصف على المُعرِّف الأصلي من Solexa/Illumina (كما هو موضح أعلاه) بالإضافة إلى طول القراءة. تم إجراء التسلسل في وضع القراءة المزدوجة (حجم الإدخال ~500 زوج قاعدي)، انظر SRR001666 . يُنتج تنسيق الإخراج الافتراضي لبرنامج fastq-dump بقعًا كاملة، تحتوي على جميع القراءات التقنية، وعادةً ما تحتوي على قراءات بيولوجية مفردة أو مزدوجة.
$ fastq-dump.2.9.0 -Z -X 2 SRR001666 قراءة خانتين لـ SRR001666 كتابة خانتين لـ SRR001666 @SRR001666.1 071112_SLXA-EAS1_s_7:5:1:817:345 الطول=72 GGGTGATGGCCGCTGCCGATGGCGTCAAATCCCACCAAGTTACCCTTAACAACTTAAGGGTTTTCAAATAGA +SRR001666.1 071112_SLXA-EAS1_s_7:5:1:817:345 الطول=72 IIIIIIIIIIIIIIIIIIIIIIIIIIIIII9IG9ICIIIIIIIIIIIIIIIIIIIIDIIIIIII>IIIIII/ @SRR001666.2 071112_SLXA-EAS1_s_7:5:1:801:338 الطول=72 GTTCAGGGATACGACGTTTGTATTTTAAGAATCTGAAGCAGAAGTCGATGATAATACGCGTCGTTTTATCAT +SRR001666.2 071112_SLXA-EAS1_s_7:5:1:801:338 الطول=72 IIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIII6IBIIIIIIIIIIIIIIIIIIIIIIIGII>IIIII-I)8Iيتضمن الاستخدام الحديث لتقنية FASTQ دائمًا تقريبًا تقسيم البقعة إلى قراءاتها البيولوجية، كما هو موضح في البيانات الوصفية التي يقدمها مقدم الطلب:
$ fastq-dump -X 2 SRR001666 --split-3 قراءة خانتين لـ SRR001666 كتابة خانتين لـ SRR001666 $ head SRR001666_1.fastq SRR001666_2.fastq ==> SRR001666_1.fastq <== @SRR001666.1 071112_SLXA-EAS1_s_7:5:1:817:345 length=36 GGGTGATGGCCGCTGCCGATGGCGTCAAATCCCACC +SRR001666.1 071112_SLXA-EAS1_s_7:5:1:817:345 length=36 IIIIIIIIIIIIIIIIIIIIIIIIIIIIII9IG9IC @SRR001666.2 071112_SLXA-EAS1_s_7:5:1:801:338 الطول=36 GTTCAGGGATACGACGTTTGTATTTTAAGAATCTGA +SRR001666.2 071112_SLXA-EAS1_s_7:5:1:801:338 الطول=36 IIIIIIIIIIIIIIIIIIIIIIIIIIIIIIII6IBI==> SRR001666_2.fastq <== @SRR001666.1 071112_SLXA-EAS1_s_7:5:1:817:345 الطول=36 AAGTTACCCTTAACAACTTAAGGGTTTTCAAATAGA +SRR001666.1 071112_SLXA-EAS1_s_7:5:1:817:345 الطول=36 IIIIIIIIIIIIIIIIIIIIDIIIIIII>IIIIII/ @SRR001666.2 071112_SLXA-EAS1_s_7:5:1:801:338 الطول=36 AGCAGAAGTCGATGATAATACGCGTCGTTTTATTCAT +SRR001666.2 071112_SLXA-EAS1_s_7:5:1:801:338 الطول=36 IIIIIIIIIIIIIIIIIIIIIIIIIGII>IIIIII-I)8Iعند وجودها في الأرشيف، يمكن لبرنامج fastq-dump محاولة استعادة أسماء القراءات إلى تنسيقها الأصلي. لا يقوم المركز الوطني لمعلومات التقانة الحيوية (NCBI) بتخزين أسماء القراءات الأصلية افتراضيًا.
$ fastq-dump -X 2 SRR001666 --split-3 --origfmt قراءة خانتين لـ SRR001666 كتابة خانتين لـ SRR001666 $ head SRR001666_1.fastq SRR001666_2.fastq ==> SRR001666_1.fastq <== @071112_SLXA-EAS1_s_7:5:1:817:345 GGGTGATGGCCGCTGCCGATGGCGTCAAATCCCACC +071112_SLXA-EAS1_s_7:5:1:817:345 IIIIIIIIIIIIIIIIIIIIIIIIIIIIII9IG9IC @071112_SLXA-EAS1_s_7:5:1:801:338 GTTCAGGGATACGACGTTTGTATTTTAAGAATCTGA +071112_SLXA-EAS1_s_7:5:1:801:338 IIIIIIIIIIIIIIIIIIIIIIIIIIIIIIII6IBI==> SRR001666_2.fastq <== @071112_SLXA-EAS1_s_7:5:1:817:345 AAGTTACCCTTAACAACTTAAGGGTTTTCAAATAGA +071112_SLXA-EAS1_s_7:5:1:817:345 IIIIIIIIIIIIIIIIIIIIDIIIIIII>IIIIII/ @071112_SLXA-EAS1_s_7:5:1:801:338 AGCAGAAGTCGATGATAATACGCGTCGTTTTATCAT +071112_SLXA-EAS1_s_7:5:1:801:338 IIIIIIIIIIIIIIIIIIIIIIGII>IIIII-I)8Iفي المثال أعلاه، استُخدمت أسماء القراءات الأصلية بدلاً من اسم القراءة المُسجّل. يُسجّل NCBI عمليات التشغيل والقراءات التي تحتويها. أسماء القراءات الأصلية، التي تُعيّنها أجهزة التسلسل، قادرة على العمل كمعرّفات فريدة محلية للقراءة، وتنقل نفس القدر من المعلومات التي ينقلها الرقم التسلسلي. تم تعيين المعرّفات المذكورة أعلاه خوارزميًا بناءً على معلومات التشغيل والإحداثيات الهندسية. قامت مُحمّلات SRA المبكرة بتحليل هذه المعرّفات وتخزين مكوناتها المُفكّكة داخليًا. توقف NCBI عن تسجيل أسماء القراءات لأنها تُعدّل بشكل متكرر عن التنسيق الأصلي للموردين لإضافة بعض المعلومات الإضافية ذات المعنى لخط أنابيب معالجة مُحدد، وقد تسبب ذلك في انتهاكات لتنسيق الاسم نتج عنها عدد كبير من الطلبات المرفوضة. بدون مخطط واضح لأسماء القراءات، تظل وظيفتها هي معرّف قراءة فريد، ينقل نفس القدر من المعلومات التي ينقلها الرقم التسلسلي للقراءة. راجع إصدارات SRA Toolkit المختلفة لمزيد من التفاصيل والمناقشات.
تجدر الإشارة أيضًا إلى أن أداة fastq-dump تحوّل بيانات FASTQ هذه من ترميز Solexa/Illumina الأصلي إلى معيار Sanger (انظر الترميزات أدناه). وذلك لأن SRA بمثابة مستودع لمعلومات NGS، وليس مجرد تنسيق . وتستطيع أدوات *-dump المختلفة إنتاج البيانات بتنسيقات متعددة من المصدر نفسه. وقد حدد المستخدمون متطلبات ذلك على مدار سنوات، حيث جاء معظم الطلب المبكر من مشروع الألف جينوم .
الاختلافات
جودة
قيمة الجودة Q هي عبارة عن تمثيل عددي صحيح لـ p (أي احتمال أن يكون استدعاء القاعدة المقابل غير صحيح). وقد تم استخدام معادلتين مختلفتين. الأولى هي صيغة سانجر القياسية لتقييم موثوقية استدعاء القاعدة، والمعروفة أيضًا باسم درجة جودة فريد .
كانت سلسلة Solexa (أي البرنامج المرفق مع جهاز تحليل الجينوم Illumina) تستخدم سابقًا عملية ربط مختلفة، حيث تشفر الاحتمالات p / (1- p ) بدلاً من الاحتمال p :
على الرغم من أن كلا التعيينين متطابقان تقريبًا عند قيم الجودة العالية، إلا أنهما يختلفان عند مستويات الجودة المنخفضة (أي، تقريبًا p > 0.05، أو ما يعادل ذلك، Q < 13).

في بعض الأحيان، كان هناك اختلاف في الآراء حول نوع التخطيط الذي تستخدمه شركة Illumina فعليًا. ينص دليل المستخدم (الملحق ب، الصفحة 122) للإصدار 1.4 من برنامج Illumina على ما يلي: "تُعرَّف النتائج على النحو التالي :[ كذا ] ، حيث p هي احتمالية استدعاء القاعدة المقابلة للقاعدة المعنية. [ 2 ] بالنظر إلى الأمر لاحقًا، يبدو أن هذا الإدخال في الدليل كان خطأً. يسرد دليل المستخدم (ما الجديد، الصفحة 5) للإصدار 1.5 من خط أنابيب Illumina هذا الوصف بدلاً من ذلك: "تغييرات مهمة في خط الأنابيب الإصدار 1.3 [ كذا ] . تم تغيير نظام تسجيل الجودة إلى نظام تسجيل Phred [أي Sanger]، المشفر كحرف ASCII عن طريق إضافة 64 إلى قيمة Phred. درجة Phred للقاعدة هي:حيث يمثل e الاحتمال المقدر لخطأ القاعدة. [ 3 ]
التشفير
- يمكن لتنسيق سانجر ترميز درجة جودة فريد من 0 إلى 93 باستخدام رموز ASCII من 33 إلى 126 (مع أن درجة جودة فريد نادرًا ما تتجاوز 60 في بيانات القراءة الخام، إلا أنه من الممكن الحصول على درجات أعلى في التجميعات أو خرائط القراءة). يُستخدم أيضًا في تنسيق SAM. [ 4 ] مع نهاية فبراير 2011، سيُنتج الإصدار الأحدث (1.8) من برنامج CASAVA التابع لشركة Illumina ملفات fastq مباشرةً بتنسيق سانجر، وفقًا للإعلان المنشور على منتدى seqanswers.com. [ 5 ]
- تُشفّر قراءات Element Biosciences AVITI وفقًا لاتفاقية سانجر: تُشفّر درجات جودة Phred من 0 إلى 93 باستخدام ASCII من 33 إلى 126. تُظهر القراءات الخام عادةً درجات جودة أساسية في نطاق [0، 55]. [ 6 ]
- تستخدم قراءات PacBio HiFi، التي تُخزن عادةً بتنسيق SAM/BAM، اصطلاح سانجر: حيث تُشفّر درجات جودة Phred من 0 إلى 93 باستخدام ASCII من 33 إلى 126. وتستخدم قراءات PacBio الفرعية الخام نفس الاصطلاح، ولكنها عادةً ما تُعيّن جودة أساسية افتراضية (Q0) لجميع القواعد في القراءة. [ 7 ]
- تُخزَّن قراءات Oxford Nanopore Duplex، التي يتم استدعاؤها باستخدام برنامج dorado basecaller، عادةً بتنسيق SAM/BAM. بعد التحويل إلى تمثيل جودة داخلي 16 بت، يكون حد جودة القاعدة المُبلغ عنه هو q50 (S). [ 8 ]
- يمكن لتنسيق Solexa/Illumina 1.0 ترميز درجة جودة Solexa/Illumina من -5 إلى 62 باستخدام ASCII من 59 إلى 126 (على الرغم من أنه في بيانات القراءة الخام، من المتوقع أن تكون درجات Solexa من -5 إلى 40 فقط).
- بدءًا من Illumina 1.3 وقبل Illumina 1.8، قام التنسيق بترميز درجة جودة Phred من 0 إلى 62 باستخدام ASCII من 64 إلى 126 (على الرغم من أنه من المتوقع في بيانات القراءة الخام أن تكون درجات Phred من 0 إلى 40 فقط).
- ابتداءً من إصدار Illumina 1.5 وقبل الإصدار 1.8، أصبحت درجات Phred من 0 إلى 2 تحمل معنىً مختلفًا بعض الشيء. لم يعد يُستخدم كل من القيمتين 0 و1، وتُستخدم القيمة 2، المُشفّرة بالحرف "B" في ترميز ASCII 66، في نهاية القراءات كمؤشر لمراقبة جودة مقطع القراءة . [ 9 ] ينص دليل Illumina [ 10 ] (الصفحة 30) على ما يلي: إذا انتهت القراءة بمقطع ذي جودة منخفضة في الغالب (Q15 أو أقل)، فسيتم استبدال جميع قيم الجودة في هذا المقطع بالقيمة 2 (المُشفّرة بالحرف B في ترميز Illumina النصي لدرجات الجودة)... لا يُشير مؤشر Q2 هذا إلى معدل خطأ مُحدد، بل يُشير إلى أنه لا ينبغي استخدام جزء نهائي مُحدد من القراءة في التحليلات اللاحقة. كما قد تظهر درجة الجودة المُشفّرة بالحرف "B" داخليًا ضمن القراءات، على الأقل حتى الإصدار 1.6 من خط المعالجة، كما هو موضح في المثال التالي:
@HWI-EAS209_0006_FC706VJ:5:58:5894:21141#ATCACG/1 TTAATTGGTAAATAAATCTCCTAATAGCTTAGATNTTACCTTNNNNNNNNNNTAGTTTCTTGAGATTTGTTGGGGGAGACATTTTTGTGATTGCCTTGAT +HWI-EAS209_0006_FC706VJ:5:58:5894:21141#ATCACG/1 efcfffffcfeefffcffffffddf`feed]`]_Ba_^__[YBBBBBBBBBRTT\]][]dddd`ddd^dddadd^BBBBBBBBBBBBBBBBBBBBBB
تم اقتراح تفسير بديل لترميز ASCII هذا. [ 11 ] كذلك، في تجارب Illumina باستخدام ضوابط PhiX، لوحظ أن الحرف 'B' يمثل "درجة جودة غير معروفة". وكان معدل الخطأ في قراءات 'B' أقل بحوالي 3 درجات فريد من متوسط الدرجة الملاحظة في التجربة الواحدة.
- ابتداءً من Illumina 1.8، عادت درجات الجودة بشكل أساسي إلى استخدام تنسيق Sanger (Phred+33).
بالنسبة للقراءات الخام، يعتمد نطاق الدرجات على التقنية المستخدمة وبرنامج تحليل القواعد، ولكنه يصل عادةً إلى 41 في تقنيات Illumina الحديثة. ونظرًا لأن أعلى درجة جودة مُسجلة سابقًا كانت 40 فقط، فإن العديد من البرامج والأدوات تتعطل عند مواجهة بيانات ذات قيم جودة أعلى من 40. أما بالنسبة للقراءات المُعالجة، فقد تكون الدرجات أعلى من ذلك. على سبيل المثال، تُسجل قيم جودة تصل إلى 45 في قراءات من خدمة تسلسل القراءة الطويلة من Illumina (المعروفة سابقًا باسم Moleculo).
بسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسسيةيهيةيةةةةةةةةةةةةةةة .............................. .......................... XXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXXX ...................... .............................. IIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIIII ...................... ................................. J JJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJJ ..................... LLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLLL .................................................... NNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNNN........................................... EEEEEE EEEEEE EEEEEE EEEEEE EEEEEE EEEEEE EEEEEE EEEEEE EEEEEE EEEEEE EEEEEE EE PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPPPP PPPP PPPP !"#$%&'()*+,-./0123456789:;<=>?@ABCDEFGHIJKLMNOPQRSTUVWXYZ[\]^_`abcdefghijklmnopqrstuvwxyz{|}~ | | | | | | | 33 59 64 73 88 104 126 0........................26...31.......40 -5....0........9.............................40 0........9............................40 3.....9..............................41 0.2......................26...31........41 0..................20........30........40........50 0..................20........30........40........50...55 0..................20........30........40........50.........................................93
S - Sanger Phred+33، قراءات خام عادةً (0، 40) X - Solexa Solexa+64، قراءات خام عادةً (-5، 40) I - Illumina 1.3+ Phred+64، قراءات خام عادةً (0، 40) J - Illumina 1.5+ Phred+64، قراءات خام عادةً (3، 41) مع 0=غير مستخدم، 1=غير مستخدم، 2=مؤشر مراقبة جودة قراءة المقطع (بالخط العريض) (ملاحظة: انظر المناقشة أعلاه). L - Illumina 1.8+ Phred+33، قراءات خام عادةً (0، 41) N - Nanopore Phred+33، قراءات مزدوجة عادةً (0، 50) E - ElemBio AVITI Phred+33، قراءات خام عادةً (0، 55) P - PacBio Phred+33، قراءات عالية الدقة عادةً (0، 93)
مساحة اللون
بالنسبة لبيانات SOLiD، تم تعديل التنسيق إلى تسلسل FASTQ ذي فضاء لوني (CSFASTQ)، حيث تُدمج القواعد في التسلسل مع الأرقام 0 و1 و2 و3، مما يشير إلى كيفية تعديل القواعد بالنسبة للقاعدة السابقة في التسلسل (0: لا تغيير؛ 1: انتقال؛ 2: تحويل غير متكامل؛ 3: تحويل متكامل). [ 1 ] يتوافق هذا التنسيق مع كيمياء التسلسل المختلفة المستخدمة في أجهزة تسلسل SOLiD. استخدمت التمثيلات الأولية قواعد النيوكليوتيدات في بداية التسلسل فقط، ولكن الإصدارات اللاحقة تضمنت قواعد مضمنة على فترات دورية لتحسين دقة تحديد القواعد ورسم الخرائط.
تتطابق قيم الجودة في CSFASTQ مع قيم الجودة في صيغة سانجر. وتختلف أدوات المحاذاة في النسخة المفضلة لديها من قيم الجودة: فبعضها يتضمن درجة جودة (مُعيّنة على 0، أي '!') للنيوكليوتيد الرائد، بينما لا يتضمنها البعض الآخر. ويتضمن أرشيف قراءات التسلسل درجة الجودة هذه.
تطورات FAST5 و HDF5
تم ابتكار تنسيق FAST4 كمشتق من تنسيق FASTQ، حيث تم تخزين احتمالات منفصلة لكل قاعدة من القواعد الأربع (A، C، G، T). وكان جزءًا من برنامج Swift basecaller، وهو حزمة مفتوحة المصدر لتحليل البيانات الأولية لبيانات التسلسل من الجيل التالي "من الصور إلى تحديد القواعد".
تم ابتكار تنسيق FAST5 كامتداد لتنسيق FAST4. ملفات FAST5 هي ملفات بتنسيق البيانات الهرمي 5 (HDF5) ذات مخطط محدد من قِبل شركة Oxford Nanopore Technologies (ONT). [ 12 ]
محاكاة
تمت معالجة محاكاة قراءة ملفات FASTQ بواسطة عدة أدوات. [ 13 ] [ 14 ] ويمكن الاطلاع على مقارنة بين هذه الأدوات هنا. [ 15 ]
ضغط
ضواغط عامة
تعتبر أدوات الضغط العامة مثل Gzip وbzip2 ملفات FASTQ ملفات نصية عادية، مما ينتج عنه نسب ضغط غير مثالية. يقوم أرشيف قراءات التسلسل التابع للمركز الوطني لمعلومات التقانة الحيوية (NCBI ) بتشفير البيانات الوصفية باستخدام نظام LZ-77. عادةً ما تضغط برامج ضغط FASTQ العامة الحقول المختلفة (أسماء القراءات، والتسلسلات، والتعليقات، ودرجات الجودة) في ملف FASTQ بشكل منفصل؛ وتشمل هذه البرامج DSRC وDSRC2 وFQC وLFQC وFqzcomp وSlimfastq.
يقرأ
يُعدّ وجود جينوم مرجعي أمرًا مفيدًا، لأنه بدلًا من تخزين تسلسلات النيوكليوتيدات نفسها، يُمكن ببساطة محاذاة القراءات مع الجينوم المرجعي وتخزين المواضع (المؤشرات) وحالات عدم التطابق؛ ثم يُمكن فرز المؤشرات وفقًا لترتيبها في التسلسل المرجعي وتشفيرها، على سبيل المثال، باستخدام تشفير طول التشغيل. عندما تكون التغطية أو محتوى التكرارات في الجينوم المُسلسل عاليًا، يؤدي ذلك إلى نسبة ضغط عالية. على عكس تنسيقات SAM /BAM، لا تُحدد ملفات FASTQ جينومًا مرجعيًا. تدعم ضواغط FASTQ القائمة على المحاذاة استخدام مرجع مُقدّم من المستخدم أو مرجع مُجمّع من الصفر : يستخدم LW-FQZip جينومًا مرجعيًا مُقدّمًا، بينما تُجري برامج Quip وLeon وk-Path وKIC عملية التجميع من الصفر باستخدام منهجية تعتمد على رسم بياني دي بروين .
عادةً ما تكون عملية ربط القراءات الصريحة والتجميع من الصفر بطيئة. تقوم ضواغط FASTQ القائمة على إعادة الترتيب بتجميع القراءات التي تشترك في سلاسل فرعية طويلة، ثم تضغط القراءات بشكل مستقل في كل مجموعة بعد إعادة ترتيبها أو تجميعها في متواليات أطول ، مما يحقق ربما أفضل توازن بين وقت التشغيل ومعدل الضغط. SCALCE هي أول أداة من هذا النوع، تلتها Orcom وMince. يستخدم BEETL تحويل Burrows-Wheeler المعمم لإعادة ترتيب القراءات، ويحقق HARC أداءً أفضل باستخدام إعادة الترتيب القائمة على التجزئة. أما AssemblTrie، فيقوم بتجميع القراءات في أشجار مرجعية بأقل عدد ممكن من الرموز في المرجع. [ 16 ] [ 17 ]
تتوفر معايير قياس الأداء لهذه الأدوات. [ 18 ]
قيم الجودة
تُشكّل قيم الجودة حوالي نصف مساحة القرص المطلوبة في تنسيق FASTQ (قبل الضغط)، ولذلك يُمكن لضغط قيم الجودة أن يُقلّل بشكلٍ كبير من متطلبات التخزين ويُسرّع تحليل ونقل بيانات التسلسل. وقد تمّ مؤخراً دراسة كلٍّ من الضغط غير الفاقد والضغط الفاقد في الأبحاث المنشورة. على سبيل المثال، تُجري خوارزمية QualComp [ 19 ] ضغطاً فاقداً بمعدل (عدد البتات لكل قيمة جودة) يُحدّده المستخدم. واستناداً إلى نتائج نظرية معدل التشوه، تُخصّص الخوارزمية عدد البتات بحيث تُقلّل متوسط مربع الخطأ (MSE) بين قيم الجودة الأصلية (غير المضغوطة) وقيم الجودة المُعاد بناؤها (بعد الضغط). ومن الخوارزميات الأخرى لضغط قيم الجودة SCALCE [ 20 ] وFastqz [ 21 ] . وكلاهما خوارزميات ضغط غير فاقد تُوفّر نهج تحويل فاقد مُتحكّم به اختيارياً. على سبيل المثال، تُقلّل SCALCE حجم الأبجدية استناداً إلى ملاحظة أن قيم الجودة "المتجاورة" متشابهة بشكل عام. للاطلاع على معيار قياس، انظر [ 22 ] .
ابتداءً من جهاز HiSeq 2500، توفر شركة Illumina خيار إخراج جودة مُصنّفة تقريبًا إلى فئات جودة. تُحسب درجات الجودة المُصنّفة مباشرةً من جدول درجات الجودة التجريبي، المرتبط بدوره بالأجهزة والبرامج والمواد الكيميائية المستخدمة أثناء تجربة التسلسل. [ 23 ]
امتداد الملف
لا يوجد امتداد ملف قياسي لملف FASTQ، ولكن يتم استخدام .fq و .fastq بشكل شائع.
محولات التنسيق
- إصدار Biopython 1.51 وما بعده (يقوم بتحويل Sanger و Solexa و Illumina 1.3+)
- إصدار EMBOSS 6.1.0 التصحيح 1 وما بعده (يقوم بتحويل Sanger و Solexa و Illumina 1.3+)
- إصدار BioPerl 1.6.1 وما بعده (يقوم بتحويل Sanger و Solexa و Illumina 1.3+)
- إصدار BioRuby 1.4.0 وما بعده (يقوم بتحويل Sanger و Solexa و Illumina 1.3+)
- إصدار BioJava 1.7.1 وما بعده (يقوم بتحويل Sanger و Solexa و Illumina 1.3+)
انظر أيضاً
مراجع
- 1 2 كوك، بي جيه إيه؛ فيلدز، سي جيه؛ غوتو، إن؛ هوير، إم إل؛ رايس، بي إم (2009). " صيغة ملف سانجر FASTQ للتسلسلات ذات درجات الجودة، ومتغيرات Solexa/Illumina FASTQ" . مجلة أبحاث الأحماض النووية . 38 (6): 1767-1771 . doi : 10.1093/nar/gkp1137 . PMC 2847217. PMID 20015970 .
- ↑ دليل مستخدم برنامج تحليل التسلسل: لإصدار Pipeline 1.4 وإصدار CASAVA 1.0، بتاريخ أبريل 2009، ملف PDF مؤرشف في 10 يونيو 2010 على موقع Wayback Machine
- ↑ دليل مستخدم برنامج تحليل التسلسل: لإصدار Pipeline 1.5 وإصدار CASAVA 1.0، بتاريخ أغسطس 2009 (ملف PDF)
- ↑ تنسيق خريطة التسلسل/المحاذاة، الإصدار 1.0، بتاريخ أغسطس 2009، بصيغة PDF
- ↑ موضوع Seqanswer عن skruglyak، بتاريخ يناير 2011 على الموقع الإلكتروني
- ↑ مواصفات تنسيق Elembio AVITI FASTQ https://docs.elembio.io/docs/bases2fastq/outputs/#quality-scores
- ↑ مواصفات تنسيق PacBio BAM 10.0.0 https://pacbiofileformats.readthedocs.io/en/10.0/BAM.html#qual
- ↑ دليل الاتصال الأساسي ثنائي الاتجاه باستخدام Dorado [duplex-tools: الاستخدام مع Dorado https://github.com/nanoporetech/duplex-tools#usage-with-dorado-recommended ]
- ↑ درجات جودة Illumina، توبياس مان، المعلوماتية الحيوية، سان دييغو، Illumina http://seqanswers.com/forums/showthread.php?t=4721
- ↑ استخدام برنامج التحكم في تسلسل محلل الجينوم، الإصدار 2.6، رقم الكتالوج SY-960-2601، رقم الجزء 15009921، المراجعة أ، نوفمبر 2009
- ↑ موقع مشروع SolexaQA
- ↑ "مقدمة إلى ملفات Fast5" . labs.epi2me.io . تم الاطلاع عليه بتاريخ 19-05-2022 .
- ↑ هوانغ، و؛ لي، ل؛ مايرز، جيه آر؛ مارث، جي تي (2012). "ART: محاكي قراءة تسلسل الجيل التالي" . المعلوماتية الحيوية . 28 (4): 593-594 . doi : 10.1093/bioinformatics/btr708 . PMC 3278762. PMID 22199392 .
- ^ براتاس، د. بينهو، جعفر. رودريغز، جي إم (2014). "XS: جهاز محاكاة القراءة FASTQ" . ملاحظات أبحاث BMC . 7 : 40. دوى : 10.1186/1756-0500-7-40 . بمك 3927261 . بميد 24433564 .
- ↑ إسكالونا، ميرلي؛ روشا، سارة؛ بوسادا، ديفيد (2016). "مقارنة بين أدوات محاكاة بيانات التسلسل الجيني من الجيل التالي" . مجلة Nature Reviews Genetics . 17 (8): 459-469 . doi : 10.1038/nrg.2016.57 . PMC 5224698. PMID 27320129 .
- ↑ جينارت إيه إيه، هوي جيه، تشو كيه، نوماناجيتش آي، كورتاد تي إيه، ساهينالب إس سي؛ وآخرون . (2018). " التمثيل الأمثل المضغوط لبيانات التسلسل عالية الإنتاجية عبر التجميع الخفيف" . نات كوميون . 9 (1): 566. Bibcode : 2018NatCo...9..566G . doi : 10.1038/s41467-017-02480-6 . PMC 5805770. PMID 29422526 .
{{cite journal}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط ) - ↑ تشو، كايوان؛ نوماناجيتش، إبراهيم؛ شاهينالب، إس. سينك (2018). "ضغط البيانات الجينومية". موسوعة تقنيات البيانات الضخمة . تشام: دار نشر سبرينغر الدولية. ص 779-783 . doi : 10.1007/978-3-319-63962-8_55-1 . ISBN 978-3-319-63962-8. S2CID 61153904 .
- ↑ نوماناجيتش، إبراهيم؛ بونفيلد، جيمس ك؛ هاش، فراز؛ فوجيس، يان؛ أوسترمان، يورن؛ ألبرتي، كلاوديو؛ ماتافيلي، ماركو؛ ساهينالب، س. سينك (24 أكتوبر 2016). "مقارنة أدوات ضغط بيانات التسلسل عالي الإنتاجية". Nature Methods . 13 (12). Springer Science and Business Media LLC: 1005–1008 . doi : 10.1038/nmeth.4037 . ISSN 1548-7091 . PMID 27776113. S2CID 205425373 .
- ↑ أوتشوا، إيدويا؛ أسناني، هيمانشو؛ بهاراديا، دينش؛ تشودري، ميناك؛ وايس مان، تساشي؛ يونا، جولان (2013). "Qual Comp : ضاغط جديد مع فقدان البيانات لدرجات الجودة بناءً على نظرية معدل التشوه" . BMC Bioinformatics . 14 : 187. doi : 10.1186/1471-2105-14-187 . PMC 3698011. PMID 23758828 .
- ↑ هاش، ف؛ نومانجيك، إ؛ ألكان، س؛ ساهينالب، س.ك. (2012). "SCALCE: تعزيز خوارزميات ضغط التسلسل باستخدام ترميز متسق محليًا" . المعلوماتية الحيوية . 28 (23): 3051-3057 . doi : 10.1093/bioinformatics/bts593 . PMC 3509486. PMID 23047557 .
- ↑ فاست كيو زد. http://mattmahoney.net/dc/fastqz/
- ↑ م. حسيني، د. براتاس، و أ. بينهو. 2016. دراسة استقصائية حول طرق ضغط البيانات للتسلسلات البيولوجية. المعلومات 7 (4): (2016): 56
- ↑ مذكرة تقنية من شركة Illumina. http://www.illumina.com/content/dam/illumina-marketing/documents/products/technotes/technote_understanding_quality_scores.pdf
روابط خارجية
- صفحة ويب MAQ تناقش متغيرات FASTQ
- المعلوماتية الحيوية
- تنسيق التسلسل البيولوجي
