ديب سيك

شركة هانغتشو ديب سيك لأبحاث تكنولوجيا الذكاء الاصطناعي الأساسية المحدودة ، [ 3 ] [ 4 ] [ 5 ] [ أ التي تُعرف تجاريًا باسم ديب سيك ، [ ب ] هي شركة صينية متخصصة في الذكاء الاصطناعي ، وتُطوّر نماذج لغوية ضخمة . يقع مقرها في هانغتشو ، بمقاطعة تشجيانغ ، وتملكها وتمولها شركة هاي فلاير ، وهي صندوق تحوط صيني . تأسست ديب سيك في يوليو 2023 على يد ليانغ وينفنغ ، الذي يشغل منصب الرئيس التنفيذي للشركتين. [ 7 ] [ 8 ] [ 9 ] أطلقت الشركة روبوت محادثة يحمل اسمها إلى جانب نموذجها ديب سيك-آر1 في يناير 2025.

قدّم نموذج DeepSeek-R1 استجاباتٍ تُضاهي نماذج التعلم الآلي الأخرى المعاصرة، مثل GPT-4 و o1 من OpenAI . [ 10 ] وأُفيد بأن تكلفة تدريبه كانت أقل من تكلفة تدريب نماذج التعلم الآلي الأخرى. وتزعم الشركة أنها درّبت V3 مقابل 6 ملايين دولار أمريكي، وهو مبلغ أقل من تكلفة تدريب GPT-4 التي أعلنت عنها OpenAI في عام 2023، والتي بلغت 100 مليون دولار أمريكي. [ 11 ] كما ادّعت DeepSeek أنها تستخدم عُشر قوة الحوسبة التي يستهلكها نموذج Meta المُماثل، Llama 3.1 . [ 11 ] [ 12 ] [ 13 ] ووُصف نجاح DeepSeek في مواجهة منافسين أكبر وأكثر رسوخًا بأنه "تغيير جذري في عالم الذكاء الاصطناعي". [ 14 ] [ 15 ]

نماذج DeepSeek مفتوحة الأوزان ، أي أن معاييرها الدقيقة متاحة للجميع، لكن بيانات التدريب غير مرخصة ترخيصًا مفتوحًا. [ 10 ] [ 16 ] منذ إطلاق DeepSeek-R1 في يناير 2025، أتاحت الشركة نماذجها الجديدة بموجب تراخيص برمجيات حرة ومفتوحة المصدر ، مثل ترخيص MIT . [ 17 ] وتفيد التقارير بأن الشركة تستقطب باحثين في مجال الذكاء الاصطناعي من أفضل الجامعات الصينية، وتوظف كوادر من خارج مجالات علوم الحاسوب التقليدية لتوسيع معارف نماذجها وقدراتها. [ 12 ] [ 14 ]

خفضت شركة DeepSeek بشكل ملحوظ تكاليف تدريب نموذجها R1 من خلال دمج تقنيات مثل مزيج الخبراء (MoE). [ 18 ] كما درّبت الشركة نماذجها خلال فترة القيود التجارية المفروضة على صادرات رقائق الذكاء الاصطناعي إلى الصين. استخدمت DeepSeek رقائق ذكاء اصطناعي أقل قوة مخصصة للتصدير، ووظفت عددًا أقل من الوحدات إجمالًا. [ 13 ] [ 19 ] وقد ذكرت جهات ناقدة مثل نيويورك بوست والغارديان أن هذا الإنجاز أحدث صدمة في القطاع ، ووصفته بأنه بمثابة لحظة فارقة للولايات المتحدة في مجال الذكاء الاصطناعي، لا سيما بفضل نماذجها مفتوحة الوزن، والفعالة من حيث التكلفة، وعالية الأداء. [ 20 ] [ 21 ] [ 22 ] وقد هدد هذا الأمر الشركات الرائدة في مجال أجهزة الذكاء الاصطناعي مثل Nvidia ، حيث انخفض سعر سهمها بشكل حاد، وخسرت 600 مليار دولار أمريكي من قيمتها السوقية، وهو أكبر انخفاض لشركة واحدة في تاريخ سوق الأسهم الأمريكية . [ 23 ] [ 24 ]

تاريخ

سنوات ما قبل التأسيس

في يونيو 2015، شارك ليانغ وينفنغ، المتحمس للذكاء الاصطناعي، في تأسيس شركة هاي فلاير، وكان يمارس التداول منذ الأزمة المالية عام 2008 أثناء دراسته في جامعة تشجيانغ . [ 25 ] بدأت الشركة تداول الأسهم باستخدام نموذج تعلم عميق يعتمد على وحدة معالجة الرسومات (GPU) في 21 أكتوبر 2016. وكانت تستخدم سابقًا نماذج خطية تعتمد على وحدة المعالجة المركزية (CPU). وبحلول نهاية عام 2017، أصبح الذكاء الاصطناعي هو المحرك الرئيسي لمعظم عمليات التداول. [ 26 ]

طائر النار

في عام ٢٠١٩، بدأت الشركة ببناء أول مجموعة حوسبة لها ، Fire-Flyer، بتكلفة ٢٠٠ مليون يوان. احتوت مجموعة الحوسبة على ١١٠٠ وحدة معالجة رسومية (GPU) متصلة ببعضها بسرعة ٢٠٠ جيجابت/ثانية، وتم إيقاف تشغيلها بعد عام ونصف من العمل. [ ٢٦ ] وبحلول عام ٢٠٢١، بدأ ليانغ بشراء كميات كبيرة من وحدات معالجة الرسوميات من إنفيديا لمشروع ذكاء اصطناعي، [ ٢٧ ] حيث أفادت التقارير أنه حصل على ١٠٠٠٠ وحدة معالجة رسومية من طراز Nvidia A100 قبل أن تقيد الولايات المتحدة مبيعات الرقائق إلى الصين. [ ٢٨ ] [ ٢٩ ]

فاير فلاير 2

بدأ إنشاء مجمع الحوسبة Fire-Flyer 2 في عام 2021 بميزانية قدرها مليار يوان. [ 26 ] وذُكر أنه في عام 2022، استُخدمت أكثر من 96% من سعة Fire-Flyer 2، بإجمالي 56.74 مليون ساعة معالجة رسومية. استُخدم 27% من سعة Fire-Flyer 2 لدعم الحوسبة العلمية خارج الشركة. [ 26 ] احتوى Fire-Flyer 2 على 5000 وحدة معالجة رسومية PCIe A100 موزعة على 625 عقدة، تحتوي كل منها على 8 وحدات معالجة رسومية. في ذلك الوقت، كان يستخدم PCIe حصريًا بدلاً من إصدار DGX من A100. ويعود ذلك إلى أن النماذج التي دُرِّبت كانت تتسع ضمن ذاكرة وصول عشوائي رسومية واحدة لوحدة المعالجة الرسومية بسعة 40 جيجابايت . وبالتالي، لم تكن هناك حاجة إلى النطاق الترددي الأعلى لـ DGX في ذلك الوقت (إذ كان يتطلب فقط توازي البيانات وليس توازي النماذج). [ 30 ] لاحقًا، تم دمج كل من NVLinks ومكتبة الاتصالات الجماعية من إنفيديا (NCCL) لتدريب نماذج أكبر تتطلب توازي النماذج. [ 31 ] [ 32 ]

التأسيس

في 14 أبريل 2023، [ 33 ] أعلنت شركة هاي فلاير عن إطلاق مختبر أبحاث الذكاء الاصطناعي العام (AGI)، موضحةً أن المختبر الجديد سيركز على تطوير أدوات الذكاء الاصطناعي غير المرتبطة بأعمال الشركة المالية. [ 34 ] [ 35 ] بعد شهرين، في 17 يوليو 2023، [ 1 ] تم فصل هذا المختبر ليصبح شركة مستقلة. سُمّي المختبر الجديد ديب سيك، وكانت هاي فلاير المستثمر والداعم الرئيسي له. [ 28 ] [ 35 ] [ 36 ] في البداية، تردد مستثمرو رأس المال المخاطر في تقديم التمويل، لاعتقادهم أنه من غير المرجح أن يتمكن المشروع من تحقيق تخارج سريع (حصة ملكية في الاستثمار). [ 28 ]

عمليات الشركة

يقع المقر الرئيسي لشركة DeepSeek في هانغتشو، بمقاطعة تشجيانغ، وهي مملوكة وممولة من قبل شركة High-Flyer . يشغل ليانغ وينفنغ ، أحد مؤسسيها ، منصب الرئيس التنفيذي. اعتبارًا من مايو 2024، كان ليانغ يمتلك شخصيًا 84% من أسهم DeepSeek من خلال شركتين وهميتين . [ ملاحظة 1 ] [ 37 ] في فبراير 2026، اتهمت شركة Anthropic شركة DeepSeek باستخدام آلاف الحسابات الاحتيالية لتوليد ملايين المحادثات مع كلود لتدريب نماذج التعلم الآلي الخاصة بها. [ 38 ] في أبريل 2026، بدأ المستثمرون بالتفاوض مع DeepSeek لجولة تمويل بقيمة 300 مليون دولار، مما سيرفع القيمة الإجمالية للشركة إلى 10 مليارات دولار. [ 39 ]في يوليو 2026، ذكرت بلومبرج وفايننشال تايمز أن الشركة بدأت الاستعدادات لطرح عام أولي من شأنه أن يؤدي إلى إدراجها في البورصة في أقرب وقت ممكن في عام 2027. [ 40 ]

صفحة تسجيل الدخول إلى DeepSeek بعد هجوم إلكتروني وقع بالتزامن مع إطلاقها في 21 يناير 2025

استراتيجية

أعلنت شركة ديب سيك أنها تركز على البحث ولا تملك خططًا فورية للتسويق التجاري. [ 41 ] ويعني هذا الموقف أيضًا أنها تستطيع تجاوز بعض بنود لوائح الذكاء الاصطناعي الصينية الموجهة للمستهلكين. [ 12 ]

يركز نهج التوظيف في شركة DeepSeek على المهارات أكثر من الخبرة العملية الطويلة، مما ينتج عنه تعيين العديد من الخريجين الجدد. [ 12 ] [ 35 ] كما تستقطب الشركة أفرادًا من غير المتخصصين في علوم الحاسوب لتوسيع نطاق الخبرات المُدمجة في النماذج، على سبيل المثال في الشعر أو الرياضيات المتقدمة. [ 12 ] [ 14 ] ووفقًا لصحيفة نيويورك تايمز ، فإن عشرات الباحثين في DeepSeek لديهم أو كان لديهم سابقًا ارتباطات بمختبرات جيش التحرير الشعبي ومنظمة أبناء الدفاع الوطني السبعة . [ 42 ]

بسبب القيود المفروضة على الرقائق الإلكترونية في الولايات المتحدة، واصلت شركة DeepSeek تحسين خوارزمياتها لزيادة الكفاءة الحسابية إلى أقصى حد، مستفيدةً من الأجهزة القديمة ومقللةً من استهلاك الطاقة. [ 43 ] : 19

توسعت شركة DeepSeek أيضًا في القارة الأفريقية نظرًا لما تقدمه من حلول ذكاء اصطناعي أقل تكلفة وأقل استهلاكًا للطاقة. وقد عززت الشركة نماذج اللغات الأفريقية، وساهمت في ظهور عدد من الشركات الناشئة، على سبيل المثال في نيروبي . إلى جانب خدمات التخزين والحوسبة السحابية التي تقدمها هواوي ، كان تأثيرها على المشهد التقني في أفريقيا جنوب الصحراء كبيرًا. توفر DeepSeek سيادة محلية على البيانات ومرونة أكبر مقارنةً بمنصات الذكاء الاصطناعي الغربية. [ 44 ]

إطار التدريب

شغّلت شركة High-Flyer/DeepSeek مجموعتين حاسوبيتين رئيسيتين على الأقل: Fire-Flyer وFire-Flyer 2. أُنشئت Fire-Flyer 1 في عام 2019، وأُغلقت بعد عام ونصف من التشغيل. أما Fire-Flyer 2، فلا تزال تعمل حتى عام 2025. تتكون Fire-Flyer 2 من بنية برمجية ومادية مصممة بشكل مشترك. من ناحية الأجهزة، تستخدم وحدات معالجة الرسومات من Nvidia وصلات بينية بسرعة 200 جيجابت في الثانية. تُقسّم المجموعة إلى منطقتين، وتدعم المنصة المهام العابرة للمنطقتين. اعتمدت بنية الشبكة على شجرتين سميكتين ، تم اختيارهما لعرض نطاق ترددي ثنائي عالي . أما من ناحية البرمجيات، فهناك: [ 26 ] [ 32 ]

  • 3FS(نظام ملفات فاير فلاير): نظام ملفات موزّع ومتوازي مصمم للقراءة العشوائية غير المتزامنة. يستخدم الإدخال/الإخراج المباشر وقراءة RDMA . على عكس الإدخال/الإخراج المخزن مؤقتًا القياسي، لا يقوم الإدخال/الإخراج المباشر بتخزين البيانات مؤقتًا. التخزين المؤقت غير مجدٍ في هذه الحالة، لأن كل جزء من البيانات المقروءة عشوائي ولا يُعاد استخدامه. [ 45 ] [ 46 ]
  • hfreduceمكتبة للاتصال غير المتزامن ، صُممت في الأصل لتحل محل مكتبة الاتصالات الجماعية من إنفيديا (NCCL). [ 30 ] تُستخدم بشكل أساسي في عملية allreduce ، وخاصةً لحساب التدرجات أثناء الانتشار العكسي . تعمل بشكل غير متزامن على وحدة المعالجة المركزية لتجنب حظر النوى على وحدة معالجة الرسومات. [ 32 ] تستخدم بثًا ثنائي الشجرة مثل NCCL. [ 30 ]
  • hfai.nn: مكتبة برمجية للمشغلين شائعة الاستخدام لتدريب الشبكات العصبية، على غرار ما هو موجود torch.nnفي PyTorch .
  • HaiScale Distributed Data Parallel(DDP): مكتبة تدريب متوازية تُطبّق أشكالًا مختلفة من التوازي، مثل توازي البيانات (DP)، وتوازي خطوط الأنابيب (PP)، وتوازي الموترات (TP)، وتوازي الخبراء (EP)، وتوازي البيانات المجزأة بالكامل (FSDP)، ومُحسِّن انعدام التكرار (ZeRO). وهي تُشبه مكتبة PyTorch DDP، التي تستخدم NCCL في الواجهة الخلفية.
  • HAI Platform: تطبيقات متنوعة مثل جدولة المهام، ومعالجة الأعطال، والتعافي من الكوارث. [ 47 ]

في عام 2022، احتوى نظام Fire-Flyer 2 على 5000 وحدة معالجة رسومية PCIe A100 موزعة على 625 عقدة، تحتوي كل منها على 8 وحدات معالجة رسومية. [ 30 ] وقد أُضيفت إليه لاحقًا تقنيتا NVLinks وNCCL لتدريب نماذج أكبر تتطلب معالجة متوازية. [ 31 ] [ 32 ]

نماذج الإفراج

مبرمج ديب سيك وماجستير ديب سيك في القانون

أصدرت شركة DeepSeek أول طراز لها، DeepSeek Coder، في 2 نوفمبر 2023. وأُصدرت سلسلة DeepSeek-Coder V2 بعد ذلك بفترة وجيزة. ثم تلتها سلسلة DeepSeek-LLM في 29 نوفمبر 2023. [ 48 ] : القسم 5

متفرقات

في يناير 2024، أصدرت شركة DeepSeek نموذجين من DeepSeek-MoE. [ 49 ] وفي 3 أبريل 2024، أصدرت ثلاثة نماذج من DeepSeek-Math. [ 50 ]

سلسلة V2

تم إصدار DeepSeek-V2 في مايو 2024. [ 51 ] وفي سبتمبر 2024، تم طرح DeepSeek-V2.5 ومراجعته في ديسمبر. [ 52 ]

سلسلة V3

في ديسمبر 2025، تم إصدار DeepSeek-V3-Base وDeepSeek-V3 (للدردشة). [ 31 ] وفي 24 مارس 2025، أصدرت DeepSeek برنامج DeepSeek-V3-0324 بموجب ترخيص MIT، وهو نسخة مُعدّلة من V3. [ 53 ] [ 54 ]

في 21 أغسطس 2025، أصدرت شركة DeepSeek الإصدار 3.1 من برنامج DeepSeek بموجب ترخيص MIT. [ 55 ] يتميز هذا النموذج ببنية هجينة تجمع بين نمطي التفكير وعدم التفكير. كما أنه يتفوق على النماذج السابقة مثل V3 وR1 بأكثر من 40% في بعض المعايير مثل SWE-bench وTerminal-bench. [ 56 ] تم تحديثه إلى الإصدار V3.1-Terminus في 22 سبتمبر 2025، والذي أصلح العديد من المشكلات اللغوية وحسّن من ذكائه بشكل عام. [ 57 ]

صدرت النسخة التجريبية من DeepSeek V3.2 في 29 سبتمبر 2025. وهي تستخدم آلية DeepSeek Sparse Attention، وهي آلية انتباه أكثر كفاءة مبنية على بحث سابق نُشر في فبراير. وقد استندت هذه النسخة إلى DeepSeek V3.1 Terminus. [ 58 ] [ 59 ] وصدرت النسخة التجريبية DeepSeek-V3.2 في 1 ديسمبر 2025، إلى جانب نسخة DeepSeek-V3.2-Speciale التي ركزت على الاستدلال. [ 60 ] [ 61 ]

سلسلة R1

في 20 نوفمبر 2024، أُتيحت معاينة DeepSeek-R1-Lite عبر الدردشة. كان نموذجًا خاصًا، إذ لم يُطرح إلا عبر واجهة برمجة التطبيقات (API) والويب. [ 62 ] [ 63 ] في 20 يناير 2025، أطلقت DeepSeek نموذج DeepSeek-R1، الذي كان مجانيًا لأنظمة iOS و Android . بحلول 27 يناير، تفوّق DeepSeek على ChatGPT ليصبح التطبيق المجاني الأكثر تحميلًا على متجر تطبيقات iOS في الولايات المتحدة، [ 14 ] مما أدى إلى انخفاض سعر سهم Nvidia بنسبة 18%. [ 64 ] [ 65 ] أصدرت DeepSeek لاحقًا العديد من الإصدارات المُحسّنة من DeepSeek R1، تتراوح بين 1.5 مليار و70 مليار مُعامل. [ 66 ]

في 28 مايو 2025، أصدرت شركة DeepSeek الإصدار DeepSeek-R1-0528 بموجب ترخيص MIT، والذي كان تحديثًا طفيفًا للإصدار R1. وقد تجاوزت نتائجه نتائج كل من DeepSeek R1 (يناير) وDeepSeek V3-0324 في بعض الاختبارات المعيارية. [ 67 ]

سلسلة V4

في 24 أبريل 2026، أصدرت شركة DeepSeek معاينةً لسلسلة V4، بما في ذلك DeepSeek-V4-Flash الذي يحتوي على 284 مليار مُعامل، وDeepSeek-V4-Pro الذي يحتوي على 1.6 تريليون مُعامل. يتميز كلا النموذجين بنافذة سياقية تصل إلى مليون رمز ، بموجب ترخيص MIT. [ 68 ] [ 69 ] [ 70 ] نافذة السياق هي حدٌّ لعدد الرموز في سياق نموذج الذكاء الاصطناعي. وقد اعتمدت شركات تصنيع أشباه الموصلات، مثل هواوي وكامبريكون تكنولوجيز ، معيار V4 . [ 71 ]

الإصدارات الرئيسية لنماذج DeepSeek. يشير اختصار SFT إلى الضبط الدقيق الخاضع للإشراف ، والذي يسمح لمختبرات الذكاء الاصطناعي بضبط سلوك نموذج الذكاء الاصطناعي بدقة.
الإصدارات الرئيسيةتاريخ الافراج عنهحالةالمتغيرات الرئيسيةرخصةملاحظات
مبرمج DeepSeek2 نوفمبر 2023تم إيقاف إنتاجهالأساس ( مدرب مسبقًا ) التوجيه (مع تعليمات مضبوطة بدقة)أوزان مفتوحة (DeepSeek)التصميم المعماري هو نفسه تصميم لاما بشكل أساسي. [ 72 ]
ديب سيك - ماجستير في القانون29 نوفمبر 2023تم إيقاف إنتاجهالدردشة الأساسية (مع SFT)التصميم المعماري هو نفسه تصميم لاما بشكل أساسي. [ 73 ]
ديب سيك-موي9 يناير 2024تم إيقاف إنتاجهدردشة أساسيةتم تطوير نسخة معدلة من MoE. [ 74 ]
ديب سيك - الرياضياتأبريل 2024تم إيقاف إنتاجهقاعدةتمت التهيئة باستخدام DS-Coder-Base-v1.5 [ 75 ]
التوجيه (مع SFT)[ 76 ]
التعلم المعزز (باستخدام نموذج مكافأة العملية)تم تطوير خوارزمية تحسين السياسات النسبية الجماعية (GRPO)، وهي نوع من أنواع خوارزمية تحسين السياسات التقريبية (PPO). [ 77 ]
ديب سيك-الإصدار الثانيمايو 2024تم إيقاف إنتاجهDeepSeek-V2، DeepSeek-V2-Chat DeepSeek-V2-Lite، DeepSeek-V2-Lite-Chat DeepSeek-Coder-V2 DeepSeek-V2.5تم تطوير آلية الانتباه الكامن متعدد الرؤوس (MLA). كما تم استخدام MoE. تم تطبيق التخزين المؤقت KV. [ 78 ]
ديب سيك-الإصدار 3ديسمبر 2024نشيطDeepSeek-V3-Base DeepSeek-V3 (نموذج الدردشة)البنية هي نفسها أساسًا في الإصدار الثاني. تم التحديث بتاريخ 24-03-2025. [ 79 ]
DeepSeek-Prover-V21 مايو 2025نشيطDeepSeek-Prover-V2-671B DeepSeek-Prover-V2-7B[ 80 ]
ديب سيك-في إل 213 ديسمبر 2024نشيط[ 81 ]
ديب سيك آر 120 نوفمبر 2024نشيطمعاينة DeepSeek-R1-Liteملكية خاصةنسخة تجريبية، يمكن الوصول إليها فقط من خلال واجهة برمجة التطبيقات (API) وواجهة الدردشة.
20 يناير 2025نشيطديب سيك-آر1 ديب سيك-آر1-زيرو ديب سيك-آر1-0528معهد ماساتشوستس للتكنولوجياتمت تهيئته من DeepSeek-V3-Base ويشترك في بنية V3. [ 67 ]
نماذج مُقطّرةتمت تهيئتها من نماذج أخرى، مثل لاما وكوين، إلخ. مستخلصة من بيانات تم تركيبها بواسطة R1 وR1-Zero. [ 82 ] [ 83 ]
28 مايو 2025نشيطديب سيك-R1-0528غير متوفر
DeepSeek-V3.121 أغسطس 2025نشيطDeepSeek-V3.1-Base DeepSeek-V3.1 (نموذج دردشة)بنية هجينة (تتوفر أوضاع التفكير وعدم التفكير). تم تدريبها على أكثر من 800 مليار رمز إضافي فوق الإصدار الثالث. [ 84 ]
22 سبتمبر 2025نشيطDeepSeek-V3.1-Terminusتقليل حالات النصوص الصينية الإنجليزية المختلطة والأحرف الشاذة العرضية بالإضافة إلى الإصدار 3.1. [ 85 ]
DeepSeek-Math-V227 نوفمبر 2025نشيطأباتشي 2.0[ 86 ]
DeepSeek-V3.21 ديسمبر 2025نشيطDeepSeek-V3.2 DeepSeek-V3.2-Specialeمعهد ماساتشوستس للتكنولوجيا[ 60 ] [ 61 ] [ 87 ]
ديب سيك-الإصدار الرابع24 أبريل 2026نشيطV4-Pro، V4-Flashإصدار تجريبي [ 68 ] [ 69 ] [ 70 ]

كانت نماذج DeepSeek الأولى مطابقةً تقريبًا لنموذج Llama، [ 48 ] الذي كان عبارة عن محولات ذات وحدة فك تشفير كثيفة فقط . أما النماذج اللاحقة فقد تضمنت الانتباه الكامن متعدد الرؤوس (MLA) وMoE والتخزين المؤقت KV. [ 49 ] [ 51 ]

يتكون المحول الذي يحتوي على وحدة فك تشفير فقط من عدة طبقات فك تشفير متطابقة. تحتوي كل طبقة من هذه الطبقات على مكونين رئيسيين: طبقة انتباه وطبقة شبكة تغذية أمامية (FFN). [ 51 ] استبدل الإصدار الثاني (V2) آلية الانتباه متعددة الرؤوس القياسية (MHA) بآلية الانتباه الكامن متعددة الرؤوس (MLA). يُدخل هذا متجهات كامنة مضغوطة لتقليل حجم ذاكرة التخزين المؤقت للقيم الرئيسية (KV) ، وبالتالي تقليل استخدام الذاكرة. [ 51 ]

تستخدم نماذج تحويل مزيج الخبراء القياسية عادةً طبقات مزيج الخبراء ذات البوابات المتفرقة في طبقات الشبكة العصبية ذات التغذية الأمامية. في طبقة مزيج الخبراء هذه، توجد عدة وحدات شبكة عصبية ذات تغذية أمامية تعمل بالتوازي (خبراء موجهون) ومصنف صغير (بوابة) لحساب درجة لكل وحدة من هذه الوحدات عند كل رمز مميز. يتم تفعيل الوحدات ذات أعلى الدرجات فقط. بدءًا من DeepSeekMoE، اعتمدت DeepSeek نسخة معدلة تضيف خبراء مشتركين، يتم تفعيلهم دائمًا. [ 49 ]

المواصفات الفنية للنماذج

نماذج DeepSeek مفتوحة الوزن، مما يوفر حرية أقل للتعديل مقارنةً ببرامج المصادر المفتوحة الحقيقية . [ 10 ] [ 16 ]

مبرمج ديب سيك

DeepSeek Coder عبارة عن سلسلة من ثمانية نماذج، أربعة منها مُدرَّبة مسبقًا ( Base) وأربعة مُحسَّنة باستخدام التعليمات ( Instruct). [ c ] جميعها بطول سياق يبلغ 16 ألف. [ 89 ] تم جعل النموذج مفتوح الأوزان بموجب ترخيص DeepSeek، والذي يتضمن قيودًا مثل الاستخدام المفتوح والمسؤول في المراحل اللاحقة. [ 90 ]

كان البرنامج التدريبي كالتالي: [ 91 ] [ 92 ] [ 93 ]

  1. التدريب المسبق: 1.8 تريليون رمز (87% شفرة مصدرية، 10% لغة إنجليزية متعلقة بالشفرة (GitHub markdown و Stack Exchange )، و3% لغة صينية غير متعلقة بالشفرة).
  2. التدريب المسبق للسياق الطويل: 200 مليار رمز. يؤدي هذا إلى زيادة طول السياق من 4 آلاف إلى 16 ألف رمز. وقد نتج عن ذلك النماذج Base.
  3. الضبط الدقيق الخاضع للإشراف (SFT): 2 مليار رمز من بيانات التعليمات. وقد أنتج هذا Instructالنماذج.

تم تدريبها على مجموعات من وحدات معالجة الرسومات A100 و H800 من Nvidia، المتصلة عبر InfiniBand و NVLink و NVSwitch . [ 91 ]

خصائص برنامج DeepSeek Coder [ 91 ] : الجدول 2 [ 94 ]
المعلمات.الطبقاتأبعاد النموذج .بُعد متوسطرؤوسرؤوس Kv
1.3 مليار24204855041616
5.7 مليار32409611008321 [ ملاحظة 2 ]
6.7 مليار324096110083232
33ب62716819200567 [ ملاحظة 2 ]

ديب سيك - ماجستير في القانون

صدرت سلسلة DeepSeek-LLM في نوفمبر 2023. تحتوي على 7 مليارات و67 مليار مُعامل في كلٍ من النموذج الأساسي ونموذج المحادثة. زعمت الورقة البحثية المصاحبة لـ DeepSeek تحقيق نتائج قياسية أعلى من Llama 2 ومعظم نماذج LLM مفتوحة المصدر في ذلك الوقت. [ 48 ] : القسم 5. يخضع رمز النموذج لرخصة DeepSeek المتاحة المصدر. [ 95 ]

كانت البنية الأساسية مماثلة لسلسلة لاما . [ د ] كان حجم المفردات في كليهما 102400 ( على مستوى البايت ) وطول السياق 4096. تم تدريبهما على 2  تريليون رمز من النصوص الإنجليزية والصينية التي تم الحصول عليها عن طريق إزالة التكرارات من Common Crawl . [ 48 ]

خصائص نموذج التعلم المحدود DeepSeek [ 48 ] : الجدول 2
المعلمات .الطبقاتأبعاد النموذج .بُعد متوسطرؤوسرؤوس Kv
304096110083232
67ب95819222016648 [ ملاحظة 2 ]

تم إصدار نسخ الدردشة من النموذجين الأساسيين في وقت واحد، وذلك من خلال تدريب النموذج الأساسي باستخدام الضبط الدقيق الخاضع للإشراف (SFT) متبوعًا بتحسين السياسة المباشر (DPO) . يُعرف تحسين السياسة المباشر أيضًا باسم التعلم المعزز من خلال التغذية الراجعة البشرية. [ 48 ]

ديب سيك-موي

يحتوي كل من نموذجي DeepSeek-MoE (الأساسي والمحادثة) على 16 مليار مُعامل (2.7 مليار مُعامل مُفعّل لكل رمز، وطول سياق 4000). كان التدريب مُشابهًا بشكل أساسي لنموذج DeepSeek-LLM 7B، وتم تدريبه على جزء من مجموعة بيانات التدريب الخاصة به. ادّعت DeepSeek أن أداءها يُضاهي أداء نموذج MoE ذي 16 مليار مُعامل، بينما يُضاهي أداء نموذج 7B غير المُعتمد على MoE. وهو مُتغير من نموذج MoE القياسي ذي البوابات المُتباعدة ، حيث يتم الاستعلام عن الخبراء المُشتركين باستمرار، بينما قد لا يتم الاستعلام عن الخبراء المُوجّهين. وجدت الشركة أن هذا يُساعد في تحقيق توازن الخبراء. في نموذج MoE القياسي، قد يُفرط في استخدام بعض الخبراء، بينما نادرًا ما يتم استخدام آخرين، مما يُهدر المساحة. تُؤدي مُحاولة تحقيق توازن في استخدام الخبراء إلى تكرارهم لنفس القدرة. اقترحوا أن يتعلم الخبراء المُشتركون القدرات الأساسية التي تُستخدم غالبًا، وأن يتعلم الخبراء المُوجّهون القدرات الثانوية التي نادرًا ما تُستخدم. [ 49 ]

ديب سيك - الرياضيات

يتضمن DeepSeek-Math ثلاثة نماذج: الأساسي، والتعليمي، والتعلم المعزز. تم تدريب نموذج الرياضيات على النحو التالي: [ 50 ]

  1. قم بالتهيئة باستخدام قاعدة بيانات DeepSeek-Coder v1.5 7B المدربة مسبقًا.
  2. تم إجراء تدريب مسبق إضافي باستخدام 500 مليار رمز (6% من مجموعة بيانات DeepSeekMath، و4% من AlgebraicStack، و10% من arXiv، و20% من كود GitHub، و10% من Common Crawl). وقد أنتج هذا النموذج الأساسي.
  3. تم تدريب نموذج لتتبع التعليمات باستخدام SFT Base مع 776 ألف مسألة رياضية وحلول خطوة بخطوة متكاملة مع استخدام الأدوات. وقد نتج عن ذلك برنامج Instruct.
  4. التعلم المعزز (RL): كان نموذج المكافأة نموذج مكافأة عملية (PRM) تم تدريبه من النموذج الأساسي وفقًا لمنهجية ماث-شيبارد. [ 96 ] ثم استُخدم نموذج المكافأة هذا لتدريب نموذج Instruct باستخدام خوارزمية تحسين السياسة النسبية الجماعية (GRPO) على مجموعة بيانات تضم 144 ألف سؤال رياضي متعلق بـ GSM8K والرياضيات . تم تحديث نموذج المكافأة باستمرار أثناء التدريب لتجنب التلاعب بالمكافأة. نتج عن ذلك التعلم المعزز.

الإصدار الثاني

يوضح الشكل 2 بنية الإصدار الثاني (V2)، بما في ذلك كل من MoE وMLA الموجهة بشكل مشترك [ 97 ] :

في مايو 2024، أطلقت شركة DeepSeek سلسلة DeepSeek-V2. تتضمن هذه السلسلة 4 نماذج، نموذجان أساسيان (DeepSeek-V2 وDeepSeek-V2 Lite) ونموذجان من روبوتات الدردشة (إصدارات الدردشة). تم تدريب النموذجين الأكبر حجمًا على النحو التالي: [ 97 ]

  1. التدريب المسبق على مجموعة بيانات مكونة من 8.1 تريليون رمز، باستخدام 12% رموز صينية أكثر من الرموز الإنجليزية.
  2. تم توسيع طول السياق من 4 كيلوبايت إلى 128 كيلوبايت باستخدام YaRN. [ 98 ] وقد نتج عن ذلك DeepSeek-V2.
  3. تم استخدام SFT مع 1.2 مليون حالة للمساعدة و0.3 مليون حالة للأمان. نتج عن ذلك Chat SFT، الذي لم يتم إصداره.
  4. تم تدريب التعلم المعزز باستخدام GRPO على مرحلتين. في المرحلة الأولى، تم تدريب النموذج على حل مسائل الرياضيات والبرمجة، باستخدام نموذج مكافأة واحد، تم تدريبه على ملاحظات المُترجم (للبرمجة) وبيانات الحقيقة الأساسية (للرياضيات). أما في المرحلة الثانية، فتم تدريب النموذج ليكون مفيدًا وآمنًا وملتزمًا بالقواعد، باستخدام ثلاثة نماذج مكافأة. تم تدريب نموذجي المكافأة الخاصين بالمفيد والأمان على بيانات تفضيلات المستخدمين، بينما تمت برمجة نموذج المكافأة القائم على القواعد يدويًا. تم تهيئة جميع نماذج المكافأة المدربة من خلال Chat (SFT)، مما أدى إلى إصدار النسخة النهائية من Chat.

اختاروا التعلم المعزز ثنائي المراحل، لأنهم وجدوا أن التعلم المعزز على بيانات الاستدلال يتميز بخصائص فريدة تختلف عن التعلم المعزز على البيانات العامة. على سبيل المثال، يمكن للتعلم المعزز على بيانات الاستدلال أن يتحسن مع زيادة عدد خطوات التدريب. [ 97 ]

كان نموذجا V2-Lite أصغر حجمًا، وتم تدريبهما بطريقة مماثلة. خضع DeepSeek-V2 Lite-Chat لتدريب SFT فقط، وليس RL. تم تدريب النسخة Lite للمساعدة في مزيد من البحث والتطوير على MLA وDeepSeekMoE. [ 97 ]

من الناحية المعمارية، اختلفت نماذج V2 اختلافًا كبيرًا عن سلسلة DeepSeek LLM. فقد غيّرت آلية الانتباه القياسية بتقريب منخفض الرتبة يُسمى الانتباه الكامن متعدد الرؤوس (MLA)، واستخدمت متغير MoE المنشور سابقًا. [ 49 ]

خصائص DeepSeek V2 [ 97 ] : القسم 3.1.2، الملحق ب [ 99 ] [ 100 ]
اسمالمعلمات .المعلمات النشطةالطبقاتطول السياق| خبراء مشتركين| خبراء مهزومون
V2-Lite15.7 مليار2.4 مليار2732 ألف264
الإصدار الثاني236ب21ب60128 ألف2160

ذكرت صحيفة فايننشال تايمز أن سعرها كان أقل من أسعار نظيراتها، حيث بلغ سعرها 2 يوان صيني لكل مليون رمز إنتاج. [ 36 ]

تضمنت سلسلة DeepSeek-Coder V2 كلاً من V2-Base وV2-Lite-Base وV2-Instruct وV2-Lite-Instruct. عملية التدريب: [ 51 ] [ ملاحظة 3 ]

  1. تم تهيئة النماذج الأساسية من نقاط التفتيش الوسيطة المقابلة بعد التدريب المسبق على 4.2 تريليون رمز (وليس الإصدار في نهاية التدريب المسبق)، ثم تم تدريبها مسبقًا بشكل أكبر على 6 تريليونات رمز، ثم تم توسيعها بالسياق إلى طول سياق 128 ألف.
  2. استُخدم برنامجا DeepSeek-Coder و DeepSeek-Math لتوليد 20 ألف بيانات تعليمات متعلقة بالبرمجة و30 ألف بيانات تعليمات متعلقة بالرياضيات، ثم جُمعت هذه البيانات مع مجموعة بيانات تعليمات تضم 300 مليون رمز. استُخدمت هذه البيانات في SFT.
  3. التعلم المعزز باستخدام GRPO. تم حساب مكافأة مسائل الرياضيات بمقارنتها بالتصنيف الصحيح. أما مكافأة مسائل البرمجة، فقد تم توليدها بواسطة نموذج مكافأة مُدرَّب على التنبؤ بما إذا كان البرنامج سيجتاز اختبارات الوحدة أم لا.

تم إنشاء DeepSeek-V2.5 من خلال دمج DeepSeek-V2-Chat و DeepSeek-Coder-V2-Instruct. [ 52 ]

الإصدار الثالث

التنبؤ متعدد الرموز

يستخدم كل من DeepSeek-V3-Base و DeepSeek-V3 (نسخة الدردشة) نفس بنية V2 مع إضافة ميزة التنبؤ متعدد الرموز ، والتي تُتيح فك تشفير الرموز الإضافية بشكل أسرع ولكن بدقة أقل. عملية التدريب: [ 31 ]

  1. تم التدريب المسبق على 14.8 تريليون رمز من مجموعة بيانات متعددة اللغات، معظمها باللغتين الإنجليزية والصينية. احتوت هذه المجموعة على نسبة أعلى من الرياضيات والبرمجة مقارنةً بمجموعة بيانات التدريب المسبق للإصدار الثاني.
  2. تم تمديد طول السياق مرتين، من 4 كيلوبايت إلى 32 كيلوبايت ثم إلى 128 كيلوبايت، باستخدام YaRN. [ 98 ] وقد أنتج هذا DeepSeek-V3-Base.
  3. تم إجراء اختبار SFT على مدى دورتين تدريبيتين باستخدام 1.5 مليون عينة من بيانات الاستدلال (الرياضيات، البرمجة، المنطق) وبيانات غير استدلالية (الكتابة الإبداعية، لعب الأدوار، الإجابة على الأسئلة البسيطة ). تم توليد بيانات الاستدلال بواسطة نماذج خبيرة، بينما تم توليد البيانات غير الاستدلالية بواسطة DeepSeek-V2.5 وتم التحقق منها من قبل فريق بشري.
    • تم تدريب نماذج الخبراء بالبدء بنموذج أساسي غير محدد، ثم باستخدام خوارزمية SFT على بيانات <المشكلة، الاستجابة الأصلية>، وبيانات اصطناعية <مطالبة النظام، المطالبة، المشكلة، استجابة R1> تم إنشاؤها بواسطة نموذج DeepSeek-R1-Lite داخلي. طلبت مطالبة النظام من R1 التفكير والتحقق أثناء عملية التفكير. بعد ذلك، تم تطبيق التعلم المعزز على نماذج الخبراء باستخدام دالة مكافأة غير معلنة.
    • تم تدريب كل نموذج خبير على توليد بيانات استدلال اصطناعية فقط في مجال محدد واحد (الرياضيات، البرمجة، المنطق).
    • تم استخدام نماذج الخبراء بدلاً من R1 نفسه، لأن مخرجات R1 نفسه عانت من الإفراط في التفكير، وسوء التنسيق، والطول المفرط.
  4. تم إنشاء نماذج المكافأة القائمة على النماذج من خلال البدء بنقطة تفتيش SFT من الإصدار الثالث، ثم ضبطها بدقة على بيانات تفضيلات المستخدم التي تحتوي على كل من المكافأة النهائية وسلسلة التفكير المؤدية إليها. وقد أنتج نموذج المكافأة إشارات مكافأة لكل من الأسئلة ذات الإجابات الموضوعية ولكن الحرة، والأسئلة التي لا تتطلب إجابات موضوعية (مثل الكتابة الإبداعية).
  5. تم تدريب نقطة تفتيش SFT للإصدار الثالث باستخدام GRPO، وذلك باستخدام نماذج المكافأة ونماذج المكافأة القائمة على القواعد. حُسبت المكافأة القائمة على القواعد لمسائل الرياضيات ذات الإجابة النهائية (الموجودة في مربع)، ولمسائل البرمجة من خلال اختبارات الوحدة. وقد نتج عن ذلك DeepSeek-V3.

أصدرت شركة DeepSeek نموذجها DeepSeek-V3-0324، الذي استخدم نفس بنية V3، في 24 مارس 2025 بموجب ترخيص MIT. [ 101 ]

خصائص DeepSeek V3 [ 31 ] : القسم 4.2 [ 102 ]
اسمالمعلمات .المعلمات النشطةالطبقاتطول السياق| خبراء مشتركين| خبراء مهزومون
الإصدار الثالث671ب37ب61128 ألف1256
إطار عمل الدقة المختلطة لـ V3[ 31 ] : الشكل 6

أجرى فريق DeepSeek تحسينات هندسية دقيقة لرفع الكفاءة، مثل استخدام حسابات متعددة الدقة . تم تنفيذ جزء كبير من عملية التمرير الأمامي باستخدام أعداد الفاصلة العائمة 8 بت (5E2M: أس 5 بت وجزء كسري 2 بت ) بدلاً من 32 بت القياسية، مما استلزم استخدام إجراءات GEMM خاصة للتجميع بدقة. استخدموا عددًا عائمًا مخصصًا 12 بت (E5M6) فقط لمدخلات الطبقات الخطية بعد وحدات الانتباه. كانت حالات المُحسِّن 16 بت ( BF16 ). قللوا زمن استجابة الاتصال من خلال تداخل الحساب والاتصال بشكل مكثف، مثل تخصيص 20 معالجًا متعددًا متدفقًا من أصل 132 لكل H800 للاتصال بين وحدات معالجة الرسومات فقط. خفضوا زمن الاتصال عن طريق إعادة ترتيب الجهاز الذي يعمل عليه كل خبير (كل 10 دقائق) لتجنب الاستعلام من أجهزة معينة أكثر من غيرها، وإضافة خسائر إضافية لموازنة الحمل إلى دالة خسارة التدريب، وتقنيات أخرى لموازنة الحمل. [ 31 ]

بعد التدريب، تم نشره على مجموعات من وحدات معالجة الرسومات H800. تم ربط وحدات معالجة الرسومات H800 الثمانية داخل المجموعة بواسطة NVLink، وتم ربط المجموعات بواسطة InfiniBand. [ 31 ]

التكلفة الإجمالية لتدريب نموذج DeepSeek-V3 [ 31 ] : الجدول 1
منصةالتكلفة (بالألف ساعة عمل لوحدة معالجة الرسومات)التكلفة (بملايين الدولارات الأمريكية)
التدريب المسبق26645.328
امتداد السياق1190.24
الكون المثالى50.01
المجموع27885.576

تمت مناقشة التكلفة ووصفها بأنها مضللة، لأنها لا تغطي سوى أجزاء من التكلفة الحقيقية. [ 103 ] [ 104 ] [ 105 ] [ 106 ]

أظهرت اختبارات الأداء أن الإصدار الثالث (V3) تفوق على الإصدارين لاما 3.1 وكوين 2.5، بينما حقق أداءً مماثلاً للإصدارين جي بي تي-4 أو وكلاود 3.5 سونيت. [ 35 ] [ 107 ] [ 108 ] [ 109 ]

R1

مسار التدريب متعدد المراحل لـ DeepSeek-R1

في يناير 2025، أصدرت شركة DeepSeek نموذج DeepSeek-R1 بموجب ترخيص MIT . [ 110 ]

تم تدريب نموذج DeepSeek-R1-Lite-Preview [ 62 ] [ 63 ] [ ملاحظة 4 ] على الاستدلال المنطقي، والتفكير الرياضي، وحل المشكلات في الوقت الفعلي. زعمت شركة DeepSeek أنها تفوقت على أداء نموذج OpenAI o1 في معايير مثل اختبار الرياضيات المدعو الأمريكي (AIME) واختبار MATH. [ 111 ] ومع ذلك، ذكرت صحيفة وول ستريت جورنال أن نموذج o1 توصل إلى حل أسرع في 15 مسألة من إصدار 2024 من اختبار AIME. [ 112 ]

تم تهيئة DeepSeek-R1 وDeepSeek-R1-Zero [ 66 ] من DeepSeek-V3-Base، وهما يشتركان في نفس البنية. أما نماذج DeepSeek-R1-Distill، فقد تم تهيئتها من نماذج أخرى مُدرَّبة مسبقًا ذات أوزان مفتوحة، بما في ذلك LLaMA و Qwen ، ثم تم ضبطها بدقة على بيانات اصطناعية مُولَّدة بواسطة R1. [ 82 ]

نموذج لـDeepSeek-R1-Zero

محادثة بين المستخدم والمساعد. يطرح المستخدم سؤالاً، ويجيب عليه المساعد. يفكر المساعد أولاً في عملية الاستدلال، ثم يقدم الإجابة للمستخدم. تُحاط عملية الاستدلال والإجابة بعلامتي <think> و <answer> على التوالي، أي: <think> عملية الاستدلال هنا </think> <answer> الإجابة هنا </answer>. المستخدم: <prompt>. المساعد:

يتم استبدال <prompt> بسؤال الاستدلال المحدد أثناء التدريب.

تم تدريب DeepSeek-R1-Zero حصريًا باستخدام GRPO RL بدون SFT. على عكس الإصدارات السابقة، لم يستخدم أي مكافأة قائمة على النموذج. كانت جميع دوال المكافأة قائمة على القواعد، وتنقسم أساسًا إلى نوعين (لم يتم تحديد أنواع أخرى): مكافآت الدقة ومكافآت التنسيق. تتمثل مكافأة الدقة في التحقق من صحة الإجابة المحددة (في الرياضيات) أو من اجتياز الكود للاختبارات (في البرمجة). أما مكافأة التنسيق فتتمثل في التحقق مما إذا كان النموذج يضع مسار تفكيره داخل وسم <think>...</think>. [ 82 ]

يُعاني R1-Zero من مشاكل في سهولة القراءة ودمج اللغات. تم تدريب R1 لمعالجة هذه المشاكل وتحسين الاستدلال بشكل أكبر: [ 82 ]

  1. SFT DeepSeek-V3-Base on thousands of cold-start data all with the standard format of |special_token|<reasoning_process>|special_token|<summary>, designed to improve model output readability.
  2. طبّق نفس عملية GRPO RL المستخدمة في R1-Zero، مع إضافة مكافأة اتساق اللغة لتشجيعه على الاستجابة بلغة واحدة. وقد نتج عن ذلك نموذج داخلي غير منشور.
  3. قم بتوليد 600 ألف بيانات استدلالية من النموذج الداخلي، مع أخذ عينات رفض (أي إذا كانت الإجابة النهائية للاستدلال المُولّد خاطئة، فسيتم حذفها). قم بتوليد 200 ألف بيانات غير استدلالية (كتابة، أسئلة وأجوبة واقعية، إدراك ذاتي، ترجمة) باستخدام DeepSeek-V3.
  4. SFT DeepSeek-V3-Base on the 800K synthetic data for 2 epochs.
  5. طبّق نفس عملية التعلم المعزز GRPO المستخدمة في R1-Zero مع مكافأة قائمة على القواعد (لمهام الاستدلال)، بالإضافة إلى مكافأة قائمة على النموذج (لمهام غير الاستدلال، والفائدة، وعدم الضرر). نتج عن ذلك DeepSeek-R1.

تم تدريب النماذج المقطرة بواسطة SFT على 800 ألف بيانات تم توليفها من DeepSeek-R1، بطريقة مشابهة للخطوة 3. لم يتم تدريبها باستخدام التعلم المعزز. [ 82 ]

V4

بنية DeepSeek-V4 و mHC

في أبريل 2026، أصدرت شركة DeepSeek معاينة لسلسلة طرازاتها الجديدة V4، والتي تخضع أيضاً لرخصة MIT. [ 68 ] [ 113 ]

لقد حسّن نموذج DeepSeek V4 من بنيته السابقة V3/R1 بالطرق التالية: [ 113 ]

  • يستخدم النموذج بنية الاتصالات الفائقة المقيدة بالمتعددات (mHC)، والتي تدعي شركة DeepSeek أنها تعزز الاتصالات المتبقية التقليدية.
  • لقد قدموا Constrained Sparse Attention (CSA) و Heavly Compressed Attention (HCA)، وهما تعديلات على آلية الانتباه المستخدمة داخل نماذج Transformer استنادًا إلى بنية DeepSeek Sparse Attention السابقة التي تم تقديمها في الإصدار V3.2.
  • تم استخدام مُحسِّن الميون لمعظم الطبقات لتحقيق تقارب أسرع وتحسين استقرار التدريب.

أصدروا نموذجين بحجمين، V4-Flash و V4-Pro. يمكن تشغيل كل منهما في وضع غير منطقي، ووضع منطقي، ووضع منطقي موسع "Max".

نماذج DeepSeek V4 [ 113 ]
المعلمةديب سيك-الإصدار 4-فلاشديب سيك-في4-برو
إجمالي المعايير284ب1.6 تيرابايت
المعلمات النشطة13ب49ب
عدد الطبقات4361
حجم الأبعاد المخفية40967168
خبراء وزارة التعليم الذين تم توجيههم256384

في الولايات المتحدة، ينص قانون تفويض الدفاع الوطني للسنة المالية 2026 على توجيه وزير الدفاع ومدير الاستخبارات الوطنية بإزالة واستبعاد أي ذكاء اصطناعي طورته شركة DeepSeek أو تملكه شركة HighFlyer من الأجهزة التي تشغلها وزارة الدفاع الأمريكية ومجتمع الاستخبارات الأمريكي أو المتعاقدين معهما. ولا يُسمح باستخدام الذكاء الاصطناعي من تطوير DeepSeek إلا بتصاريح صريحة لأغراض البحث والتدريب والتقييم أو الأنشطة العسكرية التي تدعم وظائف الأمن القومي، مثل مكافحة الإرهاب أو مكافحة التجسس . [ 114 ] [ 115 ]

في أستراليا، أصدرت وزارة الشؤون الداخلية توجيهًا حكوميًا شاملًا "لمنع استخدام أو تثبيت منتجات وتطبيقات وخدمات الويب الخاصة بـ DeepSeek، وإزالة جميع النسخ الموجودة من منتجات وتطبيقات وخدمات الويب الخاصة بـ DeepSeek من جميع أنظمة وأجهزة الحكومة الأسترالية عند العثور عليها." [ 116 ]

انظر أيضاً

ملحوظات

  1. الصينية :杭州深度求索人工智能基础技术研究有限公司. [ 6 ] يُشار إليه أحيانًا باللغة الإنجليزية ببساطة باسم الذكاء الاصطناعي Hangzhou DeepSeek .
  2. ^ الصينية :深度求索; بينيين : شوندو كيوسو
  3. التدريب المسبق هو عندما يتعلم نموذج الذكاء الاصطناعي الاحتمالات ويتنبأ بالكلمة التي من المحتمل أن تأتي تالياً. ثم يتم تثبيت معرفة النموذج في مكانها. [ 88 ]
  4. استخدمت محولًا من نوع Transformer مع RMSNorm كطريقة للتطبيع، وSwiGLU في طبقات التغذية الأمامية، والتضمين الموضعي الدوراني (RoPE)، وانتباه الاستعلام المجمع (GQA).
  1. 宁波程信柔兆企业管理咨询合伙企业(有限合伙) و宁波程恩企业管理و询合伙企业(有限合伙)
  2. 1 2 3 عدد الرؤوس لا يساوي عدد رؤوس KV، بسبب GQA.
  3. بشكل غير مفهوم، تم إصدار النموذج المذكورDeepSeek-Coder-V2 Chatفي الورقة البحثية باسمDeepSeek-Coder-V2-InstructHuggingFace.
  4. في ذلك الوقت، كانR1-Lite-Previewمن الضروري تحديد "تمكين التفكير العميق"، وكان بإمكان كل مستخدم استخدامه 50 مرة فقط في اليوم.

مراجع

  1. 1 2 "برنامج DeepSeek الجديد" . شركة سينا . 1 فبراير 2025 . تم الاسترجاع في 1 فبراير 2025 .
  2. وو، زيجينغ (14 مارس 2025). "تركز شركة ديب سيك على البحث أكثر من الإيرادات على عكس وادي السيليكون" . فايننشال تايمز . تم الاطلاع عليه بتاريخ 14 مارس 2025 .
  3. "شركة هانغتشو ديب سيك لأبحاث التكنولوجيا الأساسية للذكاء الاصطناعي المحدودة" . بلومبيرغ إل بي
  4. "اتفاقية خدمة نموذج مبرمج DeepSeek" (ملف PDF) ، DeepSeek ، 19 أكتوبر 2023، مؤرشفة (ملف PDF) من الأصل في 21 فبراير 2025 ، تم استرجاعها في 11 فبراير 2025
  5. "سياسة خصوصية مبرمجي DeepSeek" (ملف PDF) . DeepSeek . مؤرشف من الأصل (ملف PDF) بتاريخ 8 يوليو 2025. تم الاطلاع عليه بتاريخ 19 فبراير 2025 .
  6. "全国互联网安全管理平台" . beian.mps.gov.cn (باللغة الصينية (الصين)). وزارة الأمن العام لجمهورية الصين الشعبية . مؤرشفة من الأصلي في 9 فبراير 2025 . تم الاسترجاع في 9 فبراير 2025 .
  7. جيانغ، بن (21 يناير 2025). "بكين تسلط الضوء على الوجه الصيني الجديد للذكاء الاصطناعي، ليانغ وينفنغ من شركة ديب سيك" . صحيفة ساوث تشاينا مورنينغ بوست . مؤرشف من الأصل في 21 يناير 2025. تم الاطلاع عليه في 4 مارس 2025 .
  8. ^ بابتيستا ، إدواردو (28 يناير 2025). "من هو Liang Wenfeng، مؤسس DeepSeek؟" . رويترز . مؤرشفة من الأصلي في 19 فبراير 2025 . تم الاسترجاع في 4 مارس 2025 .
  9. "وراء شركة ديب سيك تكمن جامعة صينية مبهرة" . مجلة الإيكونوميست . ISSN 0013-0613 . تاريخ الاطلاع: 5 مارس 2025 . {{cite news}}: CS1 maint: deprecated archiveal service ( link )
  10. 1 2 3 جيبني، إليزابيث (23 يناير 2025). " نموذج الذكاء الاصطناعي الصيني الرخيص والمفتوح DeepSeek يُثير إعجاب العلماء" . مجلة نيتشر . 638 (8049): 13-14 . Bibcode : 2025Natur.638...13G . doi : 10.1038/d41586-025-00229-6 . PMID 39849139. مؤرشف من الأصل في 29 يناير 2025. تم الاطلاع عليه في 12 فبراير 2025 . 
  11. 1 2 فينسنت، جيمس (28 يناير 2025). "ذعر ديب سيك يكشف عن عالم ذكاء اصطناعي على وشك الانفجار" . صحيفة الغارديان .
  12. 1 2 3 4 5 ميتز، كيد؛ توبين، ميغان (23 يناير 2025). "كيف تتنافس شركة DeepSeek الصينية الناشئة في مجال الذكاء الاصطناعي مع عمالقة وادي السيليكون" . صحيفة نيويورك تايمز . ISSN 0362-4331 . مؤرشف من الأصل في 23 يناير 2025. تم الاطلاع عليه في 27 يناير 2025 . 
  13. 1 2 كوسغروف، إيما (27 يناير 2025). "نماذج DeepSeek الأرخص ورقائقها الأضعف تُثير تساؤلات حول إنفاق تريليونات الدولارات على البنية التحتية للذكاء الاصطناعي" . بزنس إنسايدر . مؤرشف من الأصل في 29 يناير 2025. تم الاطلاع عليه في 27 يناير 2025 .
  14. 1 2 3 4 ميتز، كيد (27 يناير 2025). "ما هو ديب سيك؟ وكيف يُحدث ثورة في الذكاء الاصطناعي؟" . صحيفة نيويورك تايمز . ISSN 0362-4331 . مؤرشف من الأصل في 27 يناير 2025. تم الاطلاع عليه في 27 يناير 2025 . 
  15. روز، كيفن (28 يناير 2025). "لماذا قد تُغيّر تقنية DeepSeek ما يعتقده وادي السيليكون عن الذكاء الاصطناعي؟" صحيفة نيويورك تايمز . ISSN 0362-4331 . مؤرشف من الأصل في 28 يناير 2025. تم الاطلاع عليه في 28 يناير 2025 . 
  16. 1 2 ديلبرت، كارولين (31 يناير 2025). "ديب سيك يكشف النقاب عن 'الصندوق الأسود' للذكاء الاصطناعي في الشركات" . مجلة بوبيولار ميكانيكس . مؤرشف من الأصل في 13 فبراير 2025. تم الاطلاع عليه في 12 فبراير 2025 .
  17. تشين، كايوي (12 فبراير 2026). "ما هو مستقبل الذكاء الاصطناعي الصيني مفتوح المصدر؟" . مجلة إم آي تي ​​للتكنولوجيا . تم الاطلاع عليه بتاريخ 12 أبريل 2026 .
  18. ميتز، كيد (12 فبراير 2025). "كيف استطاعت ديب سيك بناء ذكائها الاصطناعي بميزانية أقل؟" . صحيفة نيويورك تايمز . مؤرشف من الأصل في 19 مارس 2025. تم الاطلاع عليه في 21 مارس 2025 .
  19. ألين، غريغوري سي. (7 مارس 2025). "ديب سيك، هواوي، ضوابط التصدير، ومستقبل سباق الذكاء الاصطناعي بين الولايات المتحدة والصين" . مركز الدراسات الاستراتيجية والدولية .
  20. هوكينز، إيمي (28 يناير 2025). "من يقف وراء ديب سيك وكيف حقق لحظة الذكاء الاصطناعي 'سبوتنيك'؟" . صحيفة الغارديان .
  21. كاسيدي، جون (3 فبراير 2025). "هل تُعدّ ديب سيك لحظة سبوتنيك الصينية؟" . مجلة نيويوركر - عبر www.newyorker.com.
  22. رويتش، جون (28 يناير 2025). "ديب سيك: هل تسببت شركة صينية ناشئة غير معروفة في لحظة "سبوتنيك" للذكاء الاصطناعي؟" . NPR . تم الاطلاع عليه في 2 أغسطس 2025 .
  23. ساه، جاسبر (13 فبراير 2025). "ديب سيك تُحدث صدمة في وادي السيليكون" . أخبار التحرير - صحيفة حزب الاشتراكية والتحرير . مؤرشف من الأصل في 17 فبراير 2025. تم الاطلاع عليه في 13 فبراير 2025 .
  24. سيلارز، جيمس (28 يناير 2025). "ديب سيك: شركة تقنية تُعاني من أكبر انخفاض في تاريخ سوق الأسهم الأمريكية مع استحواذ شركة ذكاء اصطناعي صينية منخفضة التكلفة على وادي السيليكون" . سكاي نيوز . تم الاطلاع عليه بتاريخ 13 فبراير 2025 .
  25. تشين، كايوي (24 يناير 2025). "كيف تغلب نموذج ذكاء اصطناعي صيني رائد على العقوبات الأمريكية" . مجلة إم آي تي ​​للتكنولوجيا . مؤرشف من الأصل في 25 يناير 2025. تم الاطلاع عليه في 25 يناير 2025 .
  26. 1 2 3 4 5 "幻方 | 幻方历程" . High-Flyer (باللغة الصينية (الصين)). مؤرشف من الأصل في 3 فبراير 2025. تم الاسترجاع في 2 فبراير 2025 .
  27. أولكوت، إليانور؛ وو، زيجينغ (24 يناير 2025). "كيف صدمت شركة DeepSeek الصينية الناشئة في مجال الذكاء الاصطناعي وادي السيليكون" . فايننشال تايمز . مؤرشف من الأصل في 25 يناير 2025. تم الاطلاع عليه في 31 يناير 2025 .
  28. 1 2 3 أوتينجر، ليلي (9 ديسمبر 2024). "ديب سيك: من صندوق تحوط إلى صانع نماذج رائدة" . تشاينا توك . مؤرشف من الأصل في 28 ديسمبر 2024. تم الاسترجاع في 28 ديسمبر 2024 .
  29. ليسوينغ، كيف (23 فبراير 2023). "تعرّف على شريحة إنفيديا التي تبلغ قيمتها 10000 دولار والتي تُشغّل سباق الذكاء الاصطناعي" . سي إن بي سي . مؤرشف من الأصل في 29 يناير 2025. تم الاطلاع عليه في 30 يناير 2025 .
  30. 1 2 3 4 "hfreduce | 高性能的多卡并行通信工具" . طيران عالي . 4 مارس 2020. مؤرشفة من الأصلي في 28 يناير 2025 . تم الاسترجاع في 3 فبراير 2025 .
  31. 1 2 3 4 5 6 7 8 9 DeepSeek-AI; ليو، أيشين. فنغ، باي. وآخرون . (27 ديسمبر 2024)، التقرير الفني لـ DeepSeek-V3 ، أرخايف : 2412.19437 
  32. 1 2 3 4 آن، وي؛ بي شياو. تشن، غوانتينغ. تشن، شانهوانغ؛ دينغ، تشنغكي. دينغ، هونغوي. دونغ، كاي؛ دو، تشيوشي. جاو، ونجون؛ قوان، كانغ. قوه، جيانتشونغ؛ قوه، يونغ تشيانغ. فو، زهي؛ هو، ينغ؛ هوانغ ، بانبان (17 نوفمبر 2024). “Fire-Flyer AI-HPC: تصميم مشترك للبرامج والأجهزة فعال من حيث التكلفة للتعلم العميق”. SC24: المؤتمر الدولي للحوسبة عالية الأداء والشبكات والتخزين والتحليل . IEEE. ص 1 – 23. أرخايف : 2408.14158 . دوى : 10.1109/SC41406.2024.00089 . رقم ISBN  979-8-3503-5291-7.
  33. """"|" . Yicai . تم الاطلاع عليه في 3 فبراير 2025 .
  34. يو، شو (17 أبريل 2023). " [ حصري ] مدير تنفيذي لصندوق تحوط صيني متخصص في التحليل الكمي لن يستخدم الذكاء الاصطناعي العام لتداول الأسهم" . ييكاي غلوبال . مؤرشف من الأصل في 31 ديسمبر 2023. تم الاطلاع عليه في 28 ديسمبر 2024 .
  35. جيانغ ، بن؛ بيريزي، بيان ( 1 يناير 2025). "تعرّف على ديب سيك: الشركة الصينية الناشئة التي تُغيّر طريقة تدريب نماذج الذكاء الاصطناعي" . صحيفة ساوث تشاينا مورنينغ بوست . مؤرشف من الأصل في 22 يناير 2025. تم الاطلاع عليه في 1 يناير 2025 .
  36. 1 2 ماكمورو، رايان؛ أولكوت، إليانور (9 يونيو 2024). "صندوق الاستثمار الكمي الصيني الذي تحول إلى رائد في مجال الذكاء الاصطناعي" . فايننشال تايمز . مؤرشف من الأصل في 17 يوليو 2024. تم الاطلاع عليه في 28 ديسمبر 2024 .
  37. "大模型价格又砍一刀 这次"屠夫"竟是量化私募?" . www.cls.cn. ​10 مايو 2024. مؤرشفة من الأصلي في 27 ديسمبر 2024 . تم الاسترجاع في 3 فبراير 2025 .
  38. ميتز، كيد (23 فبراير 2026). "شركة أنثروبيك تتهم 3 شركات صينية بجمع بياناتها" . صحيفة نيويورك تايمز . الرقم الدولي الموحد للدوريات 0362-4331 . تاريخ الاطلاع: 24 فبراير 2026 . 
  39. أبو سلطان؛ ظهير كاتشوالا (18 أبريل 2026). أنيل ديسيلفا؛ ديفيكا سيامناث (محرران). "شركة DeepSeek الصينية تجمع تمويلًا بقيمة 10 مليارات دولار، بحسب تقرير The Information" . رويترز . تاريخ الاطلاع: 21 أبريل 2026 .
  40. فان، هايز (14 يوليو 2026). "ديب سيك تستعد لتقديم طلب الاكتتاب العام الأولي في أقرب وقت هذا العام" . بلومبيرغ . تم الاطلاع عليه في 14 يوليو 2026 .
  41. شنايدر، جوردان (27 نوفمبر 2024). "ديب سيك: العملاق الهادئ الذي يقود سباق الذكاء الاصطناعي في الصين" . تشاينا توك . مؤرشف من الأصل في 29 نوفمبر 2024. تم الاطلاع عليه في 28 ديسمبر 2024 .
  42. ميكل، تريب؛ سوانسون، آنا؛ توبين، ميغان؛ ميتز، كيد (16 أبريل 2025). "مسؤولون أمريكيون يستهدفون شركتي إنفيديا وديب سيك وسط مخاوف من تقدم الصين في مجال الذكاء الاصطناعي" . صحيفة نيويورك تايمز . ISSN 0362-4331 . تاريخ الاسترجاع: 17 أبريل 2025 . {{cite news}}: CS1 maint: deprecated archiveal service ( link )
  43. غرينسبان، آنا؛ كونيور، بوغنا (2025). "مقدمة: قوى عابرة ومكائد بارعة". في براتون، بنجامين؛ غرينسبان، آنا؛ أيرلندا، إيمي؛ كونيور، بوغنا (محررون). قرار الآلة ليس نهائيًا: الصين وتاريخ ومستقبل الذكاء الاصطناعي . أوربانوميك، مطبعة معهد ماساتشوستس للتكنولوجيا . ISBN 9781913029999.
  44. راي، ساريثا، لوني برينسلو، وهيلين نيامبورا "تقنية DeepSeek الصينية تتفوق على OpenAI وجوجل في أفريقيا" بلومبيرغ تكنولوجي . تاريخ الوصول: 27 أكتوبر 2025.
  45. "幻方力量 | 高速文件系统 3FS" . طيران عالي . 13 يونيو 2019 مؤرشفة من الأصلي في 3 فبراير 2025 . تم الاسترجاع في 3 فبراير 2025 .
  46. deepseek-ai/3FS ، ديب سيك، 28 فبراير 2025، مؤرشف من الأصل في 28 فبراير 2025 ، تم استرجاعه في 28 فبراير 2025
  47. "HFAiLab/hai-platform" ، هاي فلاير ، 2 فبراير 2025 ، تم الاطلاع عليه في 3 فبراير 2025
  48. 1 2 3 4 5 6 ديب سيك-AI؛ بي شياو. تشن، ديلي؛ تشن، غوانتينغ. تشن، شانهوانغ؛ داي، داماي؛ دينغ، تشنغكي. دينغ، هونغوي. دونغ، كاي (5 يناير 2024)، DeepSeek LLM: توسيع نطاق نماذج اللغات مفتوحة المصدر باستخدام المدى الطويل ، أرخايف : 2401.02954
  49. 1 2 3 4 5 داي، داماي؛ دينغ، تشنغكي. تشاو، تشنغ قانغ؛ شو، آر إكس؛ جاو، هوازو؛ تشن، ديلي؛ لي، جياشي؛ تسنغ، وانغدينغ؛ يو، شينغكاي (11 يناير 2024)، DeepSeekMoE: نحو تخصص الخبراء النهائي في نماذج اللغة المختلطة من الخبراء ، أرخايف : 2401.06066
  50. 1 2 شاو، زيهونغ؛ وانغ، بيي. تشو، تشيهاو؛ شو، رونكسين؛ سونغ، جونشياو؛ بي شياو. تشانغ، هاوي؛ تشانغ، مينغتشوان. Li، YK (27 أبريل 2024)، DeepSeekMath: دفع حدود الاستدلال الرياضي في نماذج اللغة المفتوحة ، أرخايف : 2402.03300.
  51. 1 2 3 4 5 ديب سيك-AI؛ تشو، تشيهاو؛ قوه دايا. شاو، تشى هونغ؛ يانغ، ديجيان؛ وانغ، بيي. شو، رونكسين؛ وو، Y.؛ لي ، يوكون (17 يونيو 2024)، DeepSeek-Coder-V2: كسر حاجز النماذج مغلقة المصدر في ذكاء الكود ، أرخايف : 2406.11931
  52. 1 2 "deepseek-ai/DeepSeek-V2.5 · Hugging Face" . Hugging Face . 3 يناير 2025. مؤرشف من الأصل في 30 يناير 2025. تم الاسترجاع في 28 يناير 2025 .
  53. نونيز، مايكل (24 مارس 2025). "يعمل DeepSeek-V3 الآن بسرعة 20 رمزًا في الثانية على Mac Studio، وهذا كابوس لـ OpenAI" . VentureBeat . تم الاطلاع عليه بتاريخ 24 مارس 2025 .
  54. "deepseek-ai/DeepSeek-V3-0324 · Hugging Face" . Hugging Face . مؤرشف من الأصل بتاريخ 24 مارس 2025. تم الاطلاع عليه بتاريخ 24 مارس 2025 .
  55. "deepseek-ai/DeepSeek-V3.1 · Hugging Face" . huggingface.co . 21 أغسطس 2025. تم الاطلاع عليه بتاريخ 25 أغسطس 2025 .
  56. "إصدار DeepSeek-V3.1 | وثائق واجهة برمجة تطبيقات DeepSeek" . api-docs.deepseek.com . تم الاطلاع عليه بتاريخ 25 أغسطس 2025 .
  57. "deepseek-ai/DeepSeek-V3.1-Terminus · Hugging Face" . huggingface.co . 22 سبتمبر 2025. تم الاطلاع عليه بتاريخ 24 سبتمبر 2025 .
  58. ^ يوان، جينغيانغ؛ جاو، هوازو؛ داي، داماي؛ لو، جونيو؛ تشاو، ليانغ؛ تشانغ، تشنغيان. شيه، زيندا؛ وي، واي إكس؛ وانغ ، لين (27 فبراير 2025)، الانتباه المتفرق الأصلي: الانتباه المتفرق المتوافق مع الأجهزة والقابل للتدريب أصلاً ، أرخايف : 2502.11089
  59. "deepseek-ai/DeepSeek-V3.2-Exp · Hugging Face" . huggingface.co . 29 سبتمبر 2025. تم الاطلاع عليه في 2 أكتوبر 2025 .
  60. 1 2 بايندر، مات (3 ديسمبر 2025). "DeepSeek v3.2: ما هو، وكيف يقارن بـ ChatGPT، وكيفية تجربته" . Mashable . تم الاطلاع عليه في 12 أبريل 2026 .
  61. 1 2 "إصدار DeepSeek-V3.2" . وثائق واجهة برمجة تطبيقات DeepSeek . 1 ديسمبر 2025. تم الاطلاع عليه في 12 أبريل 2026 .
  62. 1 2 "صفحة تسجيل الدخول إلى DeepSeek" . DeepSeek . تم الاسترجاع في 30 يناير 2025 .
  63. ١ ٢ "أخبار | إصدار DeepSeek-R1-Lite بتاريخ ٢٠ نوفمبر ٢٠٢٤: 🚀 معاينة DeepSeek-R1-Lite متاحة الآن: تُطلق العنان لقوة استدلال فائقة!" . وثائق واجهة برمجة تطبيقات DeepSeek . مؤرشف من الأصل بتاريخ ٢٠ نوفمبر ٢٠٢٤. تم الاطلاع عليه بتاريخ ٢٨ يناير ٢٠٢٥ .
  64. فيلد، هايدن (27 يناير 2025). "تقنية الذكاء الاصطناعي الصينية DeepSeek تُطيح بتطبيق ChatGPT من عرش متجر التطبيقات: إليك ما يجب أن تعرفه" . سي إن بي سي . مؤرشف من الأصل في 28 يناير 2025. تم الاطلاع عليه في 27 يناير 2025 .
  65. بيتشي، إيمي (27 يناير 2025). "ما هو DeepSeek، ولماذا يتسبب في انخفاض أسهم Nvidia وغيرها؟" . سي بي إس نيوز . مؤرشف من الأصل في 29 يناير 2025. تم الاطلاع عليه في 27 يناير 2025 .
  66. ١ ٢ "إصدار DeepSeek-R1 · deepseek-ai/DeepSeek-R1@23807ce" . GitHub . مؤرشف من الأصل بتاريخ ٢١ يناير ٢٠٢٥. تم الاطلاع عليه بتاريخ ٢١ يناير ٢٠٢٥ .
  67. 1 2 "الترخيص · deepseek-ai/DeepSeek-R1-0528" . 28 مايو 2025. تم الاسترجاع في 12 أبريل 2026 عبر Hugging Face .
  68. 1 2 3 سانكاران، فيشوام (24 أبريل 2026). "شركة DeepSeek الصينية تُطلق نموذج ذكاء اصطناعي جديد تدّعي أنه يتفوق على جميع منافسيها من البرامج مفتوحة المصدر" . صحيفة الإندبندنت . تاريخ الاسترجاع: 24 أبريل 2026 .
  69. 1 2 تشين، كايوي (24 أبريل 2026). "ثلاثة أسباب لأهمية نموذج DeepSeek الجديد" . مجلة MIT Technology Review . تم الاطلاع عليه بتاريخ 25 أبريل 2026 .
  70. 1 2 تولوميا، كريس (24 أبريل 2026). "ديب سيك تعود بنموذج ذكاء اصطناعي جديد مفتوح المصدر مبني على رقائق صينية" . كوارتز . تم الاسترجاع في 25 أبريل 2026 .
  71. "مصنّعو الرقائق الصينيون يتسابقون لتبني معالج DeepSeek V4. ما هي أبرز الأسماء؟" . صحيفة ساوث تشاينا مورنينج بوست . 6 مايو 2026. تاريخ الاطلاع: 7 مايو 2026 .
  72. "الترخيص · deepseek-ai/deepseek-coder-33b-base" . Hugging Face . 28 أكتوبر 2023. تم الاطلاع عليه بتاريخ 12 أبريل 2026 .
  73. "DeepSeek-LLM/LICENSE-MODEL" . GitHub . 29 نوفمبر 2023. تم الاطلاع عليه بتاريخ 12 أبريل 2026 .
  74. "DeepSeek-MoE/LICENSE-MODEL" . 11 يناير 2024. تم الاطلاع عليه في 12 أبريل 2026 عبر GitHub .
  75. "الترخيص · deepseek-ai/deepseek-math-7b-base" . Hugging Face . 6 فبراير 2024. تم الاطلاع عليه بتاريخ 12 أبريل 2026 .
  76. "الترخيص · deepseek-ai/deepseek-math-7b-instruct" . Hugging Face . 6 فبراير 2024. تم الاطلاع عليه بتاريخ 12 أبريل 2026 .
  77. "الترخيص · deepseek-ai/deepseek-math-7b-rl" . وجه معانقة . 6 فبراير 2024. تم الاسترجاع في 12 أبريل 2026 .
  78. "الترخيص · deepseek-ai/DeepSeek-V2.5" . 5 سبتمبر 2024. تم الاطلاع عليه في 12 أبريل 2026 عبر Hugging Face .
  79. "LICENSE-MODEL · deepseek-ai/DeepSeek-V3-Base" . 26 ديسمبر 2024. تم الاطلاع عليه في 12 أبريل 2026 عبر Hugging Face .
  80. "DeepSeek-Prover-V2/LICENSE-MODEL" . 30 أبريل 2025. تم الاطلاع عليه في 12 أبريل 2026 عبر GitHub .
  81. "deepseek-ai/deepseek-vl2" . 27 نوفمبر 2025. تم الاطلاع عليه في 12 أبريل 2026 عبر Hugging Face .
  82. 1 2 3 4 5 ديب سيك-AI؛ قوه دايا. يانغ، ديجيان؛ تشانغ، هاوي؛ سونغ، جونشياو؛ تشانغ، رويو؛ شو، رونكسين؛ تشو، تشيهاو؛ Ma، Shirong (22 January 2025)، “DeepSeek-R1 يحفز التفكير في LLMS من خلال التعلم المعزز”، طبيعة ، 645 (8081): 633–638 ، أرخايف : 2501.12948 ، بيب كود : 2025Natur.645..633G ، دوى : 10.1038/s41586-025-09422-z ، بمك 12443585 ، بميد 40962978  
  83. "الترخيص · deepseek-ai/DeepSeek-R1-Distill-Qwen-32B" . 20 يناير 2025. تم الاطلاع عليه في 12 أبريل 2026 عبر Hugging Face .
  84. "الترخيص · deepseek-ai/DeepSeek-V3.1-Base" . ١٩ أغسطس ٢٠٢٥. تم الاطلاع عليه في ١٢ أبريل ٢٠٢٦ عبر Hugging Face .
  85. "الترخيص · deepseek-ai/DeepSeek-V3.1-Terminus" . 22 سبتمبر 2025. تم الاطلاع عليه في 12 أبريل 2026 عبر Hugging Face .
  86. "الترخيص · deepseek-ai/DeepSeek-Math-V2" . 27 نوفمبر 2025. تم الاطلاع عليه في 12 أبريل 2026 عبر Hugging Face .
  87. "الترخيص · deepseek-ai/DeepSeek-V3.2" . 1 ديسمبر 2025. تم الاطلاع عليه في 12 أبريل 2026 عبر Hugging Face .
  88. الطيباني، سامح (2026). "حدود المعرفة في نماذج اللغة الكبيرة: آثارها على تمريض العناية المركزة" . التمريض في العناية المركزة . 31 (3) e70458. doi : 10.1111/nicc.70458 . ISSN 1478-5153 . PMID 41906802 .  
  89. الطيباني، سامح (2026). "حدود المعرفة في نماذج اللغة الكبيرة: آثارها على تمريض العناية المركزة" . التمريض في العناية المركزة . 31 (3) e70458. doi : 10.1111/nicc.70458 . ISSN 1478-5153 . PMID 41906802 .  
  90. "DeepSeek-Coder/LICENSE-MODEL at main · deepseek-ai/DeepSeek-Coder" . GitHub . مؤرشف من الأصل بتاريخ 22 يناير 2025. تم الاطلاع عليه بتاريخ 24 يناير 2025 .
  91. 1 2 3 جو، دايا؛ تشو، تشيهاو؛ يانغ، ديجيان؛ شيه، زيندا؛ دونغ، كاي؛ تشانغ، وينتاو؛ تشن، غوانتينغ. بي شياو. Wu، Y. (26 يناير 2024)، DeepSeek-Coder: عندما يلتقي نموذج اللغة الكبير بالبرمجة – ظهور ذكاء الكود ، أرخايف : 2401.14196
  92. "DeepSeek Coder" . deepseekcoder.github.io . مؤرشف من الأصل بتاريخ 27 يناير 2025. تم الاطلاع عليه بتاريخ 27 يناير 2025 .
  93. deepseek-ai/DeepSeek-Coder ، ديب سيك، 27 يناير 2025، مؤرشف من الأصل في 27 يناير 2025 ، تم استرجاعه في 27 يناير 2025
  94. "deepseek-ai/deepseek-coder-5.7bmqa-base · Hugging Face" . Hugging Face . تم الاطلاع عليه بتاريخ 27 يناير 2025 .
  95. deepseek-ai/DeepSeek-LLM ، ديب سيك، 27 يناير 2025 ، تم الاطلاع عليه في 27 يناير 2025
  96. وانغ، بيي؛ لي، لي؛ شاو، تشيهونغ؛ وآخرون (19 فبراير 2024)، ماث-شيبارد: التحقق من نماذج التعلم الآلي وتعزيزها خطوة بخطوة دون تعليقات بشرية ، arXiv : 2312.08935 .
  97. 1 2 3 4 5 DeepSeek-AI؛ ليو، أيكسين؛ فينغ، بي؛ وآخرون (19 يونيو 2024)، DeepSeek-V2: نموذج لغوي قوي واقتصادي وفعال يعتمد على مزيج من الخبراء ، arXiv : 2405.04434 .
  98. 1 2 بينغ، بوين؛ كيسنيل، جيفري؛ فان، هونغلو؛ شيبول، إنريكو (1 نوفمبر 2023)، YaRN: امتداد نافذة السياق الفعال لنماذج اللغة الكبيرة ، arXiv : 2309.00071.
  99. "config.json · deepseek-ai/DeepSeek-V2-Lite at main" . Hugging Face . 15 مايو 2024. تم الاطلاع عليه بتاريخ 28 يناير 2025 .
  100. "config.json · deepseek-ai/DeepSeek-V2 at main" . Hugging Face . 6 مايو 2024. تم الاطلاع عليه بتاريخ 28 يناير 2025 .
  101. فينغ، كوكو (25 مارس 2025). "ديب سيك تُبهر المبرمجين بنموذج V3 مفتوح المصدر أكثر قوة" . صحيفة ساوث تشاينا مورنينغ بوست . تاريخ الاسترجاع: 6 أبريل 2025 .
  102. "config.json · deepseek-ai/DeepSeek-V3 at main" . Hugging Face . 26 ديسمبر 2024. مؤرشف من الأصل في 26 يناير 2025. تم الاطلاع عليه في 28 يناير 2025 .
  103. ثوبرون، روب (3 فبراير 2025). "تكاليف الذكاء الاصطناعي لشركة DeepSeek تتجاوز بكثير ادعاء 5.5 مليون دولار، وربما وصلت إلى 1.6 مليار دولار باستخدام 50,000 وحدة معالجة رسومية من Nvidia" . TechSpot . تم الاطلاع عليه في 13 فبراير 2025 .
  104. كاجال، كابيل (31 يناير 2025). "بحث يكشف أن تكلفة تدريب الذكاء الاصطناعي لشركة ديب سيك ليست 6 ملايين دولار، بل 1.3 مليار دولار" . ياهو نيوز . مؤرشف من الأصل في 13 فبراير 2025. تم الاطلاع عليه في 13 فبراير 2025 .
  105. باتيل، ديلان؛ كورابي، إيه جيه؛ أولافلين، ديلان؛ كنوتسن، دوغ (31 يناير 2025). "مناقشات ديب سيك: القيادة الصينية حول التكلفة، وتكلفة التدريب الحقيقية، وتأثيرات هامش النموذج المغلق" . سيمي أناليسيس . مؤرشف من الأصل في 13 فبراير 2025. تم الاسترجاع في 13 فبراير 2025 .
  106. ^ “مارتن فيتشيف من INSAIT: “تكلفة التدريب على DeepSeek البالغة 6 ملايين دولار مضللة”TheRecursive.com . 28 يناير 2025. مؤرشف من الأصل في 13 فبراير 2025. تم الاطلاع عليه في 13 فبراير 2025 .
  107. جيانغ، بن (27 ديسمبر 2024). "نموذج الذكاء الاصطناعي الجديد لشركة DeepSeek الصينية الناشئة يتفوق على منتجات Meta وOpenAI" . صحيفة ساوث تشاينا مورنينغ بوست . مؤرشف من الأصل في 27 ديسمبر 2024. تم الاطلاع عليه في 28 ديسمبر 2024 .
  108. شارما، شوبهام (26 ديسمبر 2024). "DeepSeek-V3، نظام ذكاء اصطناعي مفتوح المصدر فائق الضخامة، يتفوق على Llama وQwen عند إطلاقه" . VentureBeat . مؤرشف من الأصل في 27 ديسمبر 2024. تم الاطلاع عليه في 28 ديسمبر 2024 .
  109. ويغرز، كايل (26 ديسمبر 2024). "يبدو أن نموذج الذكاء الاصطناعي الجديد من DeepSeek هو أحد أفضل المنافسين "المفتوحين" حتى الآن" . TechCrunch . مؤرشف من الأصل في 2 يناير 2025. تم الاطلاع عليه في 31 ديسمبر 2024 .
  110. إدواردز، بنج (21 يناير 2025). "نموذج "استدلال" صيني متطور ينافس OpenAI o1 - وهو متاح للتنزيل مجانًا" . آرس تكنيكا . تم الاطلاع عليه في 16 فبراير 2025 .
  111. فرانزن، كارل (20 نوفمبر 2024). "نموذج الاستدلال الأول من DeepSeek، R1-Lite-Preview، يلفت الأنظار، متفوقًا على أداء OpenAI o1" . VentureBeat . مؤرشف من الأصل في 22 نوفمبر 2024. تم الاطلاع عليه في 28 ديسمبر 2024 .
  112. هوانغ، رافاييل (24 ديسمبر 2024). "لا تنظر الآن، لكن الذكاء الاصطناعي الصيني يلحق بالركب بسرعة" . صحيفة وول ستريت جورنال . مؤرشف من الأصل في 27 ديسمبر 2024. تم الاطلاع عليه في 28 ديسمبر 2024 .
  113. 1 2 3 DeepSeek-AI؛ شو، أنيي؛ لين، بانغكاي؛ وآخرون (26 أبريل 2026)، DeepSeek-V4: نحو ذكاء سياقي عالي الكفاءة لمليون رمز ، arXiv : 2606.19348 
  114. "أحكام الأمن السيبراني والذكاء الاصطناعي في قانون تفويض الدفاع الوطني للسنة المالية 2026" . www.congress.gov . تاريخ الاطلاع: 6 يوليو 2026 .
  115. السيناتور جون كورنين [جمهوري - تكساس (18 ديسمبر 2025). "نص - S.1071 - الكونغرس الـ119 (2025-2026): قانون تفويض الدفاع الوطني للسنة المالية 2026" . www.congress.gov . تم الاطلاع عليه في 6 يوليو 2026 .
  116. "تحديث توجيهات PSPF - منتجات وتطبيقات وخدمات ويب DeepSeek" . Protectivesecurity.gov.au/ . 4 فبراير 2025. مؤرشف من الأصل في 7 فبراير 2025. تم الاطلاع عليه في 9 يوليو 2026 .