قاعدة بيانات التسلسل
في مجال المعلوماتية الحيوية ، تُعدّ قاعدة بيانات التسلسل نوعًا من قواعد البيانات البيولوجية التي تتألف من مجموعة كبيرة من تسلسلات الأحماض النووية أو البروتينات أو غيرها من تسلسلات البوليمرات المُخزّنة رقميًا على الحاسوب. تُعدّ قاعدة بيانات UniProt مثالًا على قاعدة بيانات تسلسل البروتينات . ففي عام 2013، احتوت على أكثر من 40 مليون تسلسل، وهي تنمو بمعدل متسارع. [ 1 ] تاريخيًا ، كانت التسلسلات تُنشر ورقيًا، ولكن مع ازدياد عددها، أصبحت هذه الطريقة غير عملية.
يبحث
يتضمن البحث في قاعدة بيانات التسلسل البحث عن أوجه التشابه بين تسلسل جينومي/بروتيني وسلسلة استعلام، وإيجاد التسلسل في قاعدة البيانات الذي يُطابق التسلسل المستهدف "بأفضل شكل" (استنادًا إلى معايير تختلف باختلاف طريقة البحث). يُستخدم عدد التطابقات/النتائج لحساب درجة تُحدد مدى التشابه بين تسلسل الاستعلام والتسلسلات في قاعدة البيانات. [ 2 ] والهدف الرئيسي هو تحقيق توازن جيد بين هذين المعيارين.
تاريخ
1950
بدأت الحاجة إلى قواعد بيانات التسلسل في عام 1950 عندما نشر فريدريك سانجر البنية الأولية للأنسولين . وقد فاز بجائزة نوبل الثانية لابتكاره طرقًا لتسلسل الأحماض النووية، وكان نهجه المقارن هو ما حفّز علماء الكيمياء الحيوية البروتينية الآخرين على البدء في جمع تسلسلات الأحماض الأمينية. وهكذا بدأت قواعد البيانات الجزيئية. [ 3 ]
1960
في عام 1965، نشرت مارغريت دايوف وفريقها في المؤسسة الوطنية للأبحاث الطبية الحيوية (NBRF) كتاب "أطلس تسلسل البروتين وبنيته". ضمّنوا في الأطلس جميع تسلسلات البروتينات المعروفة ، حتى تلك غير المنشورة. ويمكن اعتبار هذا العمل أول محاولة لإنشاء قاعدة بيانات جزيئية . استخدم الفريق نظام تحليل واسترجاع الأدبيات الطبية (MEDLARS) المحوسب حديثًا (عام 1964) في المعاهد الوطنية للصحة (NIH). استخدم الفريق الحواسيب لتخزين البيانات، لكنهم اضطروا إلى كتابة كل تسلسل وتدقيقه يدويًا، مما استنزف الكثير من الوقت والمال. [ 3 ]
في عام 1966، أصدر الفريق الطبعة الثانية من الأطلس، ضعف حجم الطبعة الأولى. احتوت على حوالي 1000 تسلسل، وقد وُصفت هذه الفترة آنذاك بانفجار معلوماتي. كان المركز الوطني لأبحاث علم الأحياء (NBRF) في طليعة استخدام الحواسيب في الطب وعلم الأحياء في ذلك الوقت. استغلت دايوف وفريقها مرافق المركز لتحديد تسلسلات الأحماض الأمينية لجزيئات البروتين باستخدام الحواسيب المركزية. استمر عدد التسلسلات المكتشفة في النمو، مما أتاح إجراء تحليل مقارن أعمق للبروتينات لم يسبق له مثيل. أدى ذلك إلى العديد من التطورات، مثل النماذج الاحتمالية لاستبدال الأحماض الأمينية، ومحاذاة التسلسلات، والأشجار التطورية للعلاقات التطورية للبروتينات. [ 3 ]
سبعينيات القرن العشرين
أصبحت عملية التسلسل بأكملها مؤتمتة بالكامل. [ 3 ]
1980
تم إنشاء أول قاعدة بيانات لتسلسل النيوكليوتيدات . كانت تُعرف سابقًا باسم مكتبة بيانات تسلسل النيوكليوتيدات التابعة للمختبر الأوروبي للبيولوجيا الجزيئية (EMBL) (وتُعرف الآن باسم الأرشيف الأوروبي للنيوكليوتيدات). بدأ مشروع الجينوم البشري في عام 1988. وكان هدف المشروع هو تحديد تسلسل جميع الجينات في الإنسان ورسم خرائطها، الأمر الذي تطلب القدرة على إنشاء قاعدة بيانات تسلسل ضخمة واستخدامها. [ 4 ]
الوقت الحاضر
لدينا الآن العديد من قواعد بيانات التسلسل، وأدوات لاستخدامها، وسهولة الوصول إليها. ومن أكبرها GenBank التي تحتوي على أكثر من ملياري تسلسل. [ 3 ]
الجدول الزمني

القضايا الراهنة
التخزين والتكرار
تُودع السجلات في قواعد بيانات التسلسل من مصادر متنوعة، بدءًا من الباحثين الأفراد وصولًا إلى مراكز تسلسل الجينوم الكبيرة. ونتيجةً لذلك، قد تختلف جودة التسلسلات نفسها، ولا سيما الشروح البيولوجية المرفقة بها. كما يوجد قدر كبير من التكرار ، إذ قد تُرسل مختبرات متعددة تسلسلات عديدة متطابقة، أو شبه متطابقة، مع تسلسلات أخرى في قواعد البيانات. [ 5 ]
تعتمد العديد من بيانات ترميز التسلسلات ليس على التجارب المخبرية، بل على نتائج عمليات البحث عن تشابه التسلسلات التي سبق ترميزها. وبمجرد ترميز تسلسل ما بناءً على تشابهه مع تسلسلات أخرى، وإيداعه في قاعدة البيانات، يصبح أساسًا لترميزات مستقبلية. قد يؤدي هذا إلى مشكلة الترميز المتعدي ، إذ قد تحدث عدة عمليات نقل للترميز عن طريق تشابه التسلسلات بين سجل معين في قاعدة البيانات ومعلومات تجريبية مخبرية فعلية . [ 6 ] لذا، يجب توخي الحذر عند تفسير بيانات الترميز من قواعد بيانات التسلسلات.
أساليب التسجيل
تعتمد معظم خوارزميات البحث في قواعد البيانات الحالية على نظام تقييم يُحدد مدى تطابق النتائج، وهو عادةً نظام تقييم مُحدد. [ 7 ] ويكمن الحل لهذه المشكلة في توفير مجموعة متنوعة من أنظمة التقييم لتناسب كل مشكلة على حدة.
إحصائيات المحاذاة
غالباً ما تنتج خوارزميات البحث قائمة مرتبة تفتقر إلى الأهمية البيولوجية. [ 8 ]
انظر أيضاً
- تنسيق FASTA – تنسيق ملف لتسلسلات الحمض النووي أو البروتين
- مشروع SIMAP – مشروع حوسبة تطوعي قائم على BOINC
- قائمة قواعد البيانات البيولوجية
- المعلوماتية الحيوية – التحليل الحاسوبي لمجموعات كبيرة ومعقدة من البيانات البيولوجية
مراجع
- ↑ كوكرين، ج.؛ كارش-ميزراتشي، إ.؛ ناكامورا، ي. (23 نوفمبر 2010). "التعاون الدولي لقاعدة بيانات تسلسل النيوكليوتيدات" . أبحاث الأحماض النووية . 39 (قاعدة البيانات): D15– D18. doi : 10.1093/nar/gkq1150 . PMC 3013722. PMID 21106499 .
- ↑ سونغ، وينغ-كين (2010). الخوارزميات في المعلوماتية الحيوية : مقدمة عملية . بوكا راتون: تشابمان آند هول/سي آر سي برس. ص 109. ISBN 9781420070330.
- 1 2 3 4 5 هاجن، جويل ب. (2011)، "أصل قواعد بيانات التسلسل واستقبالها المبكر" ، في هاماشر، مايكل؛ آيزناخر، مارتن؛ ستيفان، كريستيان (محررون)، التنقيب عن البيانات في علم البروتينات: من المعايير إلى التطبيقات ، مناهج في البيولوجيا الجزيئية، المجلد 696، توتوا، نيوجيرسي: مطبعة هومانا، الصفحات 61-77 ، doi : 10.1007/978-1-60761-987-1_4 ، ISBN 978-1-60761-987-1PMID 21063941 ، تم الاطلاع عليه في 5 مايو 2022
- ↑ "التاريخ < EMBL-EBI" . www.ebi.ac.uk. تم الاطلاع عليه بتاريخ 5 مايو 2022 .
- ↑ سيكيتش، ك.؛ كاروجو، أ. (2010). " تقليل تكرار تسلسل البروتين: مقارنة بين طرق مختلفة" . المعلوماتية الحيوية . 5 (6): 234-239 . doi : 10.6026/97320630005234 . PMC 3055704. PMID 21364823 .
- ↑ إيليوبولوس، آي.؛ تسوكا، إس.؛ أندرادي، إم. إيه.؛ إنرايت، إيه. جيه.؛ كارول، إم.؛ بوليه، بي.؛ برومبوناس، في.؛ لياكوبولوس، تي.؛ وآخرون . (أبريل 2003). "تقييم استراتيجيات الشرح باستخدام تسلسل جينومي كامل" . المعلوماتية الحيوية . 19 (6): 717-26 . doi : 10.1093/bioinformatics/btg077 . PMID 12691983 .
- ↑ ألتشول، ستيفن؛ بوغوسكي، مارك؛ غيش، وارن؛ ووتون، جون (1994). "مشكلات في البحث في قواعد بيانات التسلسل الجزيئي" ( ملف PDF) . علم الوراثة الطبيعية . 6 (2). مجموعة نيتشر للنشر: 119-129 . doi : 10.1038/ng0294-119 . PMID 8162065. S2CID 270160 .
- ↑ ألتشول، ستيفن؛ بوغوسكي، مارك؛ غيش، وارن؛ ووتون، جون (1994). "مشكلات في البحث في قواعد بيانات التسلسل الجزيئي" ( ملف PDF) . علم الوراثة الطبيعية . 6 (2). مجموعة نيتشر للنشر: 119-129 . doi : 10.1038/ng0294-119 . PMID 8162065. S2CID 270160 .
روابط خارجية
- قواعد بيانات المعهد الأوروبي للمعلوماتية الحيوية
- الجينومات التي تم تسلسلها بالكامل من قبل المركز الوطني لمعلومات التقانة الحيوية (NCBI)
- قاعدة بيانات جينوم الخميرة من جامعة ستانفورد
- قاعدة بيانات البروتينات التابعة للمعاهد الوطنية للصحة (NIH) هي مجموعة من التسلسلات من مصادر متعددة، بما في ذلك الترجمات من المناطق المشفرة المشروحة في GenBank و RefSeq و TPA ، بالإضافة إلى سجلات من SwissProt و PIR وPRF و PDB.
- قواعد بيانات التكنولوجيا الحيوية
