7 أسرار تقود ثورة استدلال الذكاء الاصطناعي عبر تحالف AMD و Cerebras

الكاتب،محمد محروس رزق
توليد الكلمات وتحليل النصوص لم يعد مجرد رفاهية تقنية، بل أصبح المعركة الحقيقية التي تحدد من سيسيطر على مستقبل التقنية. عندما نتحدث عن استدلال الذكاء الاصطناعي، فإننا نتحدث عن التكلفة، والسرعة، وقدرة العتاد على تلبية طلبات ملايين المستخدمين في أجزاء من الثانية،
لفترة طويلة، اعتمدت الصناعة على بطاقات الرسوميات التقليدية، لكننا وصلنا إلى طريق مسدود هندسياً واقتصادياً. هنا أدركت شركتا AMD و Cerebras أن الحل ليس في تكبير حجم البطاقة، بل في تغيير قواعد اللعبة بالكامل عبر هندسة حوسبية تفصل المهام عن بعضها. دعونا نغوص في لغة الأرقام والسيليكون لنكشف كيف أطاحت هذه الشراكة بالبنى التقليدية لمراكز البيانات.
1. الفلسفة الثورية: تفكيك مراحل الاستدلال (Disaggregation)
في البنى التقليدية، تقوم أي شريحة سيليكون بمعالجة المدخلات (Prefill) وتوليد الكلمات (Decode) في نفس الوقت. المشكلة؟ معالجة المدخلات تتطلب قوة حوسبة غاشمة لفهم السياق، بينما توليد الكلمات يتطلب سرعة ذاكرة مرعبة لإنتاج الرموز دون تأخير. إجبار شريحة واحدة على فعل الاثنين يخلق “اختناقاً مرورياً”.

.التحالف الجديد قسّم المهام بذكاء قاتل.
- منصة AMD Helios: تتولى فك تشفير السياقات الضخمة بفضل قدرتها على التوازي.
- محرك Cerebras WSE-3: يتفرغ لإنتاج الرموز بسرعة جنونية.
| وجه المقارنة | تحالف AMD و Cerebras | البنية التقليدية (GPUs) |
|---|---|---|
| مرحلة السياق (Prefill) | مخصصة بالكامل لمعالجات AMD EPYC | تتم على نفس الشريحة (تسبب اختناق) |
| توليد الرموز (Decode) | مخصصة بالكامل لمحرك Cerebras WSE | تزاحم مرحلة السياق على نفس الذاكرة |
2. العتاد المضيف: وحش مراكز البيانات (Zen 6)
لإطعام رقاقة عملاقة بالبيانات، أنت بحاجة إلى مضيف جبار. هنا يتدخل معالج AMD EPYC 9006 (Venice) ليثبت أنه من أفضل معالجات مراكز البيانات في 2026. المعالج الرائد (SP7) يوفر 256 نواة في المقبس الواحد، ويدعم حزم ذاكرة MRDIMM التي تنقل البيانات بسرعة 1.6 تيرابايت/ثانية.

بلغة المال (CAPEX)، خادم يعتمد على معالجين من AMD يتفوق على خادم بأربعة معالجات من Intel، ويوفر لك نصف التكلفة تقريباً!
| التكلفة الرأسمالية (CAPEX) | خادم AMD EPYC 9996 (2P) | خادم Intel Xeon 6980P (4P) |
|---|---|---|
| إجمالي الأنوية | 512 نواة | 512 نواة |
| تكلفة المعالجات فقط | $23,976 | $55,820 |
| إجمالي التكلفة للمضيف | $46,476 (توفير 47%) | $87,820 |
3. رقاقة Cerebras WSE-3: كسر حاجز السرعة
بينما تحاول الشركات ربط مئات البطاقات الصغيرة بشبكات معقدة، صنعت Cerebras رقاقة بحجم كتاب من قرص سيليكون كامل! هذه الرقاقة تحتوي على 900 ألف نواة و 44 جيجابايت من ذاكرة SRAM المدمجة. النتيجة؟ لا يوجد شيء اسمه “اختناق اتصال”، وسرعة الذاكرة تصل إلى 21 بيتابايت في الثانية.

| الميزة | Wafer-Scale Engine (WSE-3) | Nvidia H100 / B200 |
|---|---|---|
| الحجم الفيزيائي | أكبر بـ 57 مرة من الـ GPU القياسي | شريحة صغيرة محدودة المساحة |
| إنتاجية المستخدم | 2000 – 2500 رمز/ثانية | 50 – 300 رمز/ثانية |
| شبكة الربط | داخلية بالكامل (انعدام التأخير) | تتطلب InfiniBand أو NVLink |
4. الحل البرمجي المبتكر: البث المباشر (Zero-Copy)
العتاد القوي يحتاج إلى كود برمجي نظيف. الاعتماد على DataLoader التقليدي لـ PyTorch يستهلك موارد المعالج. الحل الذي نقدمه هنا يعتمد على “البث المباشر من الذاكرة المقيدة صفرياً” (Zero-Copy Streaming).

هذا الكود يقرأ البيانات من القرص مباشرة لتغذية الرقاقة، مما يخفض العبء البرمجي بنسبة 90%
🛠️ تعريف النموذج
يجب تعريف متغير model قبل سطر التجميع، وإلا سيتوقف الكود.
📁 ملف البيانات
تأكد من وجود ملف all_tokens.bin في نفس مسار التشغيل لتجنب خطأ FileNotFoundError.
⚠️ بيئة التشغيل
الكود مصمم حصرياً لخوادم Cerebras CSX ولن يعمل على الأجهزة الشخصية أو المعالجات العادية.
5. المصاريف التشغيلية (OPEX): الفوز بالضربة القاضية
السباق الحقيقي في خوادم الحوسبة السحابية ليس في ثمن الشراء، بل في فاتورة الكهرباء. بفضل كفاءة استهلاك الطاقة، يخفض هذا التحالف تكلفة تشغيل النماذج (Cost per Token) بشكل جذري. سعر الاستدلال التجاري الآن مع Cerebras يبلغ 10 سنتات فقط لكل مليون رمز (لنموذج Llama 8B).
دعونا نقارن فاتورة الطاقة السنوية للمضيفين:
| فاتورة الطاقة (OPEX) سنويًا | AMD EPYC 9996 (2P) | Intel Xeon 6980P (4P) |
|---|---|---|
| الاستهلاك عند الذروة | 1.5 كيلوواط | 2.6 كيلوواط |
| الاستهلاك السنوي (مع PUE) | 16,425 kWh | 28,470 kWh |
| التكلفة النهائية (0.12$/kWh) | $1,971 | $3,416 |
6. أتمتة البنية التحتية وضبط عقد NUMA
لضمان أقصى سرعة في استدلال الذكاء الاصطناعي، يجب ضبط إعدادات الـ BIOS لتعمل بوضعية (NPS4) لتقليل زمن استجابة الذاكرة لأقل من 60 نانومتر. بدلًا من القيام بذلك يدوياً، جهزت لك سكريبت يعتمد على Redfish API لتهيئة مئات الخوادم دفعة واحدة، مع أمر لينكس لعزل العمليات التشغيلية.
⚙️ المتطلبات وتعديل البيانات
تحتاج لتثبيت مكتبة requests، وتغيير الآيبيهات و(admin/pass) لتطابق بيانات الـ BMC الخاصة بخوادمك.
🚀 الجزء الأول: سكريبت بايثون
يتم تشغيله كملف بايثون عادي من أي جهاز على نفس الشبكة لإرسال إعدادات الـ BIOS لكل الخوادم دفعة واحدة.
💻 الجزء الثاني: أمر لينكس
بعد إعادة تشغيل الخادم، يُنفذ السطر الأخير (numactl...) داخل موجه أوامر اللينكس (Terminal) لربط المعالجة بالعقدة 0.
7. التوسع العنقودي (Linear Scalability): نهاية معضلة النماذج التريليونية
عند بناء نماذج ذكاء اصطناعي ضخمة تتخطى التريليون معلمة، تعاني البطاقات التقليدية من هدر كارثي في الأداء بسبب تعقيدات الربط الشبكي وتقسيم البيانات. هنا يبرز السر السابع للتحالف عبر هندسة السرب (Swarm Architecture)

التي تدمج عدة رقاقات WSE-3 لتعمل معاً كـ “شريحة واحدة عملاقة” تحت إدارة معالجات AMD EPYC. هذا التناغم يحقق توسعاً خطياً مثالياً؛ حيث تتضاعف القوة الإنتاجية بنسبة 100% مع كل إضافة للعتاد دون أي اختناق مروري.
🧠 هندسة السرب
ربط الرقاقات لتعمل كعقل واحد متصل لتشغيل النماذج التريليونية.
📈 توسع خطي
مضاعفة العتاد تعني مضاعفة الأداء بنسبة 100% حرفياً.
🚫 صفر هدر
إلغاء التعقيد البرمجي لتقسيم البيانات عبر الشبكات الخارجية.
| كفاءة التوسع (Scaling) | عناقيد Cerebras Swarm | مجموعات GPUs التقليدية |
|---|---|---|
| هدر الأداء مع إضافة عقد جديدة | 0% (توسع خطي مثالي) | يصل إلى 40% هدر في المزامنة |
| التعقيد البرمجي | نظام التشغيل يراه كشريحة منطقية واحدة | يتطلب تقسيم هندسي (Tensor Parallelism) |
🚀 نهاية احتكار الـ GPUs
نرى في “دروع تقني” أن التفكيك المعماري (Disaggregation) سيكون المعيار الذهبي للمراكز السحابية بحلول عام 2028.
⚙️ الكفاءة البرمجية
العتاد الخارق لا قيمة له دون كود نظيف؛ دمج حلول الـ Zero-Copy يثبت أن السوفت وير هو الروح التي تحرك العتاد.
الأسئلة الشائعة (FAQ)
لماذا وضع NPS4 مهم جداً لمعالجات AMD؟
لأنه يقسم المعالج ذو الـ 256 نواة إلى 4 عقد مادية، مما يربط الأنوية بالذاكرة الأقرب لها ويمنع تأخير نقل البيانات للرقاقة.
كيف ألغى Cerebras ضريبة الاتصال البيني؟
عبر وضع النموذج بالكامل (حتى 44 جيجابايت) داخل الذاكرة المدمجة للشريحة، مما ألغى الحاجة لتقطيع البيانات عبر شبكات خارجية مبطئة.
ما هو البث المباشر (Zero-Copy)؟
هو تقنية برمجية تقرأ البيانات من القرص الصلب مباشرة إلى الرقاقة دون نسخها عشوائياً في الذاكرة المركزية، مما يقلل الحمل على الـ CPU بنسبة 90%.
تابع صفحتنا الرسمية على فيسبوك
احصل على أحدث الأخبار والتحليلات التقنية مباشرة في صفحتك
