أداة تحليل التسلسل
أداة تحليل التسلسل في المعلوماتية الحيوية هي نوع من البرامج التي تعرض معلومات متعلقة بتسلسل جيني أو اسم جين أو كلمة مفتاحية مُدخلة. تستقبل هذه الأدوات عادةً استعلامًا، مثل تسلسل الحمض النووي (DNA) أو الحمض النووي الريبوزي (RNA ) أو البروتين ، أو كلمة مفتاحية، ثم تبحث في قاعدة بيانات واحدة أو أكثر عن معلومات متعلقة بهذا التسلسل. وتُقدم ملخصات ونتائج مُجمعة بتنسيق موحد، تصف المعلومات التي كان سيتطلب تجميعها سابقًا زيارة العديد من المواقع الصغيرة أو البحث المباشر في المراجع العلمية. العديد من أدوات تحليل التسلسل عبارة عن بوابات برمجية تُسهّل عملية البحث عن معلومات حول استعلام معين في العدد الكبير والمتزايد من قواعد بيانات المعلوماتية الحيوية. ويمكن الوصول إلى هذه الأدوات إما عبر الإنترنت أو من خلال تنزيل ملفات تنفيذية محلية.
مقدمة واستخدام
لقد أدى عصر "ما بعد الجينوم " إلى ظهور مجموعة من الأدوات والبرامج القائمة على الويب لتجميع وتنظيم وتقديم كميات كبيرة من معلومات التسلسل الأولي ، بالإضافة إلى هياكل البروتين ، وشروح الجينات، ومحاذاة التسلسل ، ومهام المعلوماتية الحيوية الشائعة الأخرى.
بشكل عام، توجد ثلاثة أنواع من قواعد البيانات ومزودي الخدمات. يشمل النوع الأول قواعد البيانات العامة أو المفتوحة الوصول الشائعة، المدعومة بالتمويل والمنح، مثل NCBI و ExPASy و Ensembl و PDB . أما النوع الثاني، فيشمل قواعد بيانات أصغر أو أكثر تخصصًا، تُنظمها وتُجمعها مجموعات بحثية فردية، ومن أمثلتها قاعدة بيانات جينوم الخميرة وقاعدة بيانات الحمض النووي الريبوزي (RNA) (مؤرشفة في 15 سبتمبر 2002 في أرشيفات مكتبة الكونغرس على الإنترنت ). أما النوع الثالث والأخير، فيشمل قواعد البيانات الخاصة بالشركات أو المؤسسات، والتي تتطلب دفع رسوم أو انتسابًا مؤسسيًا للوصول إليها. تُعد هذه الأمثلة نادرة نظرًا لانتشار قواعد البيانات العامة عالميًا، إلا إذا كانت الخدمة قيد التطوير أو كانت الغاية النهائية من التحليل ذات قيمة تجارية.
تُصبح السيناريوهات النموذجية لمنهجية تحليل التسلسل ذات أهمية، لا سيما في حالتي المجموعتين الأوليين، حيث يرغب الباحثون عادةً في دمج المعلومات المستمدة من مصادر متعددة حول استعلام واحد أو تسلسل مستهدف. على سبيل المثال، قد يستخدم المستخدمون أداة BLAST لمحاذاة التسلسل والبحث لتحديد نظائر الجين محل الاهتمام في أنواع أخرى، ثم يستخدمون هذه النتائج لتحديد موقع بنية بروتينية محلولة لأحد هذه النظائر. وبالمثل، قد يرغبون أيضًا في معرفة البنية الثانوية المحتملة للرنا المرسال الذي يشفر الجين محل الاهتمام، أو ما إذا كانت إحدى الشركات تبيع تركيبًا من الحمض النووي يحتوي على هذا الجين. تعمل أدوات تحليل التسلسل على أتمتة عملية البحث عن هذه المعلومات المتباينة ودمجها، وذلك بجعل عملية البحث في قواعد بيانات خارجية متعددة شفافة للمستخدم.
ترتبط العديد من قواعد البيانات العامة بالفعل بشكل واسع، مما يسهل الوصول إلى المعلومات التكميلية في قواعد البيانات الأخرى؛ فعلى سبيل المثال، يرتبط كل من Genbank و PDB ارتباطًا وثيقًا. ومع ذلك، قد يصعب دمج الأدوات المتخصصة التي تنظمها وتستضيفها مجموعات بحثية محددة في جهود الربط هذه، نظرًا لتركيزها الضيق، أو تعديلها المتكرر، أو استخدامها نسخًا مخصصة من تنسيقات الملفات الشائعة. تشمل مزايا أدوات تحليل التسلسل إمكانية استخدام عدة أدوات متخصصة في استعلام واحد وعرض النتائج بواجهة مشتركة، وإمكانية توجيه مخرجات مجموعة من الأدوات أو عمليات البحث في قواعد البيانات إلى مدخلات مجموعة أخرى، والقدرة على توزيع التزامات الاستضافة والتجميع على شبكة من المجموعات والمؤسسات البحثية بدلًا من مستودع مركزي واحد.
أدوات تحليل البيانات القائمة على الكلمات المفتاحية
تندرج معظم أدوات تحليل البيانات المتاحة على الإنترنت اليوم ضمن هذه الفئة. عند زيارة الموقع/الأداة، يُدخل المستخدم أي معلومات ذات صلة، مثل كلمة مفتاحية (مثل: ضمور العضلات، داء السكري، إلخ)، أو أرقام الوصول في بنك الجينات (GenBank )، أو معرّف بنك بيانات البروتين (PDB ID). تُعرض جميع نتائج البحث ذات الصلة بتنسيق خاص بكل أداة. تُعد أدوات تحليل البيانات القائمة على البحث بالكلمات المفتاحية محركات بحث متخصصة للغاية في مجال المعلوماتية الحيوية، مما يُزيل فوضى النتائج غير ذات الصلة أو غير العلمية التي قد تظهر مع محرك بحث تقليدي مثل جوجل . تتيح معظم أدوات تحليل البيانات القائمة على الكلمات المفتاحية أنواعًا مرنة من إدخال الكلمات المفتاحية، وأرقام الوصول من قواعد البيانات المفهرسة، بالإضافة إلى أوصاف الكلمات المفتاحية التقليدية.
لكل أداة من أدوات تحليل البيانات تركيزها ومجال اهتمامها الخاص. فعلى سبيل المثال، يُصنّف محرك البحث Entrez التابع للمركز الوطني لمعلومات التقانة الحيوية (NCBI) نتائج البحث حسب الفئة، بحيث يمكن للمستخدمين الباحثين عن معلومات حول بنية البروتين استبعاد التسلسلات التي لا تتوافق مع بنيتها، بينما يمكن للمستخدمين المهتمين باستعراض الأدبيات العلمية حول موضوع معين الاطلاع على ملخصات الأبحاث المنشورة في المجلات العلمية دون تشتيت انتباههم بنتائج الجينات أو التسلسلات. وتُعد قاعدة بيانات PubMed للأدبيات العلمية في مجال علوم الحياة أداة شائعة للبحث في الأدبيات، على الرغم من أن هذه الخدمة تُضاهي تقريبًا خدمة Google Scholar الأكثر شمولية .
تُقدّم خدمات تجميع البيانات القائمة على الكلمات المفتاحية، مثل خدمة Bioinformatic Harvester ، تقارير من مجموعة متنوعة من خوادم الجهات الخارجية بتنسيقها الأصلي، ما يُغني المستخدمين عن زيارة الموقع الإلكتروني أو تثبيت البرامج لكل خدمة على حدة. ويُعدّ هذا الأمر بالغ الأهمية، لا سيما مع الانتشار السريع لمواقع عديدة تُقدّم أدوات مختلفة لتحليل ومعالجة التسلسلات. كما تحتوي بوابة ويب تجميعية أخرى، هي قاعدة بيانات البروتينات البشرية المرجعية ( Hprd )، على مدخلات مُعَلَّقة ومُدقَّقة يدويًا للبروتينات البشرية. وبالتالي، فإن المعلومات المُقدّمة انتقائية وشاملة في آنٍ واحد، كما أن صيغة الاستعلام مرنة وسهلة الاستخدام. وتشمل مزايا تطوير قواعد البيانات المُدقَّقة يدويًا عرض المواد المُدقَّقة ومفهوم "المراجع الجزيئية" لتولي مسؤولية بروتينات مُحدّدة. إلا أن عيوبها تكمن في بطء تحديثها عادةً، واحتمالية عدم احتوائها على بيانات حديثة أو مُختلف عليها.
محللات البيانات التسلسلية
تُوسّع أدوات تحليل التسلسل النموذجية نطاق هذه العملية باستخدام تسلسل الحمض النووي (DNA) أو الحمض النووي الريبوزي (RNA) أو البروتين كمدخل، وتتيح للمستخدم الوصول إلى أدوات تحليلية مختلفة عبر الإنترنت للحصول على المعلومات المطلوبة. وتُرفق هذه الأدوات عادةً مع أجهزة المختبرات التجارية، مثل أجهزة تسلسل الجينات، أو تُباع أحيانًا كتطبيقات برمجية لعلم الأحياء الجزيئي. وفي مثال آخر من قواعد البيانات العامة، يُقدّم تقرير بحث تسلسل BLAST من المركز الوطني لمعلومات التقانة الحيوية (NCBI) رابطًا من تقرير المحاذاة إلى معلومات أخرى ذات صلة في قواعد بياناته، إن وُجدت.
على سبيل المثال، سيحتوي السجل المسترجع الذي يتضمن تسلسلًا بشريًا على رابط منفصل يُوصل إلى موقعه على خريطة الجينوم البشري؛ أما السجل الذي يحتوي على تسلسل تم تحديد بنيته ثلاثية الأبعاد، فسيحتوي على رابط يُوصله بقاعدة بيانات بنيته. تربط أداة Sequerome ، وهي أداة خدمة عامة، تقرير BLAST بالكامل بالعديد من خوادم/مواقع الطرف الثالث التي تُقدم خدمات متخصصة للغاية في معالجة التسلسلات، مثل خرائط إنزيمات التقييد ، وتحليلات إطار القراءة المفتوح لتسلسلات النيوكليوتيدات ، والتنبؤ بالبنية الثانوية . تُوفر الأداة ميزة إضافية تتمثل في الاحتفاظ بسجل بحث للعمليات التي يُجريها المستخدم، والذي يُمكن أرشفته بسهولة باستخدام وظائف "البريد الإلكتروني" أو "الطباعة" أو "الحفظ". وبالتالي، يُمكن إتمام عملية البحث الكاملة عن تسلسل باستخدام أدوات بحث مختلفة، ومن ثم إنجاز المشروع بالكامل، من خلال واجهة متصفح واحدة. وبناءً على ذلك، ستتضمن الأجيال القادمة من أدوات تحليل التسلسل إمكانية التعاون عبر الإنترنت مع الباحثين لمشاركة سجلات المشاريع وأدوات البحث، وشرح نتائج تحليل التسلسل أو العمل المخبري، وتخصيص معالجة مجموعات بيانات التسلسل وأتمتتها، وما إلى ذلك. يُعدّ InstaSeq أداة بحث مدعومة من جوجل، تُمكّن المستخدم من إدخال تسلسل مباشرةً والبحث في شبكة الإنترنت العالمية بأكملها. يتميز محرك البحث الفريد هذا، وهو الوحيد من نوعه، عن البحث في قواعد بيانات محددة مثل GenBank .
نتيجةً لذلك، قد يحصل المستخدم على مستند مُستضاف بشكل خاص أو صفحة من قاعدة بيانات أقل شهرة من أي مكان تقريبًا في العالم. ورغم ندرة استخدام أدوات تحليل التسلسل في الوقت الراهن، إلا أن دورها المحوري سيتضح جليًا عند الحاجة إلى معالجة كميات هائلة من بيانات التسلسل عبر البوابات والمجالات المختلفة.
النمو والتوجهات المستقبلية
يُسهم انتشار أدوات المعلوماتية الحيوية لتحليل الجينات في مساعدة الباحثين على تحديد وتصنيف الجينات ومجموعات الجينات ذات الأهمية في أبحاثهم؛ إلا أن التنوع الكبير في الأدوات التي تؤدي وظائف تجميعية وتحليلية متشابهة إلى حد كبير قد يُربك المستخدمين الجدد ويُحبطهم. ويتيح التوزيع اللامركزي الذي تُشجعه أدوات التجميع لمجموعات البحث الفردية الاحتفاظ بخوادم متخصصة مخصصة لأنواع محددة من تحليل البيانات، على أمل أن تُجمع نتائجها في تقرير شامل حول جين أو بروتين يهم باحثين آخرين.
تُعدّ البيانات الناتجة عن تجارب المصفوفات الدقيقة، وفحص التفاعل الثنائي ، وغيرها من التجارب البيولوجية عالية الإنتاجية، ضخمةً ويصعب تحليلها يدويًا؛ كما أن جهود التعاون في مجال علم الجينوم البنيوي، والتي تهدف إلى حلّ أعداد كبيرة من هياكل البروتينات شديدة التنوع بسرعة، تزيد من الحاجة إلى التكامل بين قواعد بيانات التسلسل والبنية والبوابات الإلكترونية. هذا الدافع نحو تطوير أساليب أكثر شمولية وسهولة في الاستخدام لتحليل التسلسل يجعل هذا المجال من المجالات البحثية النشطة بين باحثي علم الجينوم الحاليين.
انظر أيضاً
مراجع
- بيري إس، نافارو جيه دي، كريستيانسن تي زد، وآخرون (يناير 2004). "قاعدة بيانات مرجعية للبروتينات البشرية كمورد لاكتشاف البروتينات" . مجلة أبحاث الأحماض النووية . 32 (عدد قواعد البيانات): D497–501. doi : 10.1093/nar/gkh070 . PMC 308804. PMID 14681466 .
- ليبيل يو . كيندلر ب . بيبركوك ر (أغسطس 2004). ""هارفستر": محرك بحث سريع شامل لموارد البروتين البشري . المعلوماتية الحيوية . 20 (12): 1962-1963 . doi : 10.1093/bioinformatics/bth146 . PMID 14988114 .
- غانيسان ن؛ بينيت ن ف؛ فيلاوثابيلاي م؛ باتابيرامان ن؛ سكواير ر؛ كالياناسوندام ب (أغسطس 2005). "واجهة ويب تُسهّل تحليل تسلسل وبنية تقارير محاذاة BLAST" . BioTechniques . 39 (2): 186، 188. doi : 10.2144/05392BM05 . PMID 16116790 .
- بيتون ج؛ سميث سي (نوفمبر 2005). "جوجل مقابل ببمد" . حوليات الكلية الملكية للجراحين في إنجلترا . 87 (6): 491-492 . doi : 10.1308/003588405X71207 . PMC 1964102. PMID 16263030 .
- هانتر إل؛ كوهين كيه بي (مارس 2006). " معالجة اللغة الطبية الحيوية: ما وراء ببمد؟" . الخلية الجزيئية . 21 (5): 589-94 . doi : 10.1016/j.molcel.2006.02.012 . PMC 1702322. PMID 16507357 .
- غانيسان ن؛ كالياناسوندام ب؛ فيلاوثابيلاي م (مارس 2007). "أدوات تحليل بيانات المعلوماتية الحيوية: مقدمة لتحليل التمثيل الغذائي". ندوة المحيط الهادئ للحوسبة الحيوية : 127-132 . PMID 17990486 .
- برامج المعلوماتية الحيوية
