عاجل

7 أسرار تقود ثورة استدلال الذكاء الاصطناعي عبر تحالف AMD و Cerebras

7 أسرار تقود ثورة استدلال الذكاء الاصطناعي عبر تحالف AMD و Cerebras
تكامل عتاد مراكز البيانات بين معالجات EPYC ورقاقات WSE-3 لتحقيق سرعات قياسية.

الكاتب،محمد محروس رزق 

توليد الكلمات وتحليل النصوص لم يعد مجرد رفاهية تقنية، بل أصبح المعركة الحقيقية التي تحدد من سيسيطر على مستقبل التقنية. عندما نتحدث عن استدلال الذكاء الاصطناعي، فإننا نتحدث عن التكلفة، والسرعة، وقدرة العتاد على تلبية طلبات ملايين المستخدمين في أجزاء من الثانية،

​لفترة طويلة، اعتمدت الصناعة على بطاقات الرسوميات التقليدية، لكننا وصلنا إلى طريق مسدود هندسياً واقتصادياً. هنا أدركت شركتا AMD و Cerebras أن الحل ليس في تكبير حجم البطاقة، بل في تغيير قواعد اللعبة بالكامل عبر هندسة حوسبية تفصل المهام عن بعضها. دعونا نغوص في لغة الأرقام والسيليكون لنكشف كيف أطاحت هذه الشراكة بالبنى التقليدية لمراكز البيانات.


​1. الفلسفة الثورية: تفكيك مراحل الاستدلال (Disaggregation)

​في البنى التقليدية، تقوم أي شريحة سيليكون بمعالجة المدخلات (Prefill) وتوليد الكلمات (Decode) في نفس الوقت. المشكلة؟ معالجة المدخلات تتطلب قوة حوسبة غاشمة لفهم السياق، بينما توليد الكلمات يتطلب سرعة ذاكرة مرعبة لإنتاج الرموز دون تأخير. إجبار شريحة واحدة على فعل الاثنين يخلق “اختناقاً مرورياً”.

مخطط يوضح تفكيك مهام استدلال الذكاء الاصطناعي بين AMD Helios و Cerebras
مخطط يوضح تفكيك مهام استدلال الذكاء الاصطناعي بين AMD Helios و Cerebras.

.التحالف الجديد قسّم المهام بذكاء قاتل.

  • منصة AMD Helios: تتولى فك تشفير السياقات الضخمة بفضل قدرتها على التوازي.
  • محرك Cerebras WSE-3: يتفرغ لإنتاج الرموز بسرعة جنونية.
وجه المقارنةتحالف AMD و Cerebrasالبنية التقليدية (GPUs)
مرحلة السياق (Prefill)مخصصة بالكامل لمعالجات AMD EPYCتتم على نفس الشريحة (تسبب اختناق)
توليد الرموز (Decode)مخصصة بالكامل لمحرك Cerebras WSEتزاحم مرحلة السياق على نفس الذاكرة
💡 ملحوظة: اسحب الجدول يميناً ويساراً. فصل المهام يمنع “التجويع الحوسبي” للعتاد.

2. العتاد المضيف: وحش مراكز البيانات (Zen 6)

​لإطعام رقاقة عملاقة بالبيانات، أنت بحاجة إلى مضيف جبار. هنا يتدخل معالج AMD EPYC 9006 (Venice) ليثبت أنه من أفضل معالجات مراكز البيانات في 2026. المعالج الرائد (SP7) يوفر 256 نواة في المقبس الواحد، ويدعم حزم ذاكرة MRDIMM التي تنقل البيانات بسرعة 1.6 تيرابايت/ثانية.

خادم متطور يعرض العتاد المضيف ومعالج AMD EPYC Venice ذو الـ 256 نواة
كفاءة العتاد المضيف في تزويد مراكز البيانات بقوة الحوسبة والذاكرة الفائقة.

​بلغة المال (CAPEX)، خادم يعتمد على معالجين من AMD يتفوق على خادم بأربعة معالجات من Intel، ويوفر لك نصف التكلفة تقريباً!

التكلفة الرأسمالية (CAPEX)خادم AMD EPYC 9996 (2P)خادم Intel Xeon 6980P (4P)
إجمالي الأنوية512 نواة512 نواة
تكلفة المعالجات فقط$23,976$55,820
إجمالي التكلفة للمضيف$46,476 (توفير 47%)$87,820
💡 ملحوظة: خوادم AMD ثنائية المقابس لا تتطلب أنظمة تبريد سائل معقدة مقارنة بـ Intel رباعية المقابس.

3. رقاقة Cerebras WSE-3: كسر حاجز السرعة

​بينما تحاول الشركات ربط مئات البطاقات الصغيرة بشبكات معقدة، صنعت Cerebras رقاقة بحجم كتاب من قرص سيليكون كامل! هذه الرقاقة تحتوي على 900 ألف نواة و 44 جيجابايت من ذاكرة SRAM المدمجة. النتيجة؟ لا يوجد شيء اسمه “اختناق اتصال”، وسرعة الذاكرة تصل إلى 21 بيتابايت في الثانية.

استعراض هندسي لـ رقاقة Cerebras WSE-3 المصنوعة من قرص سيليكون كامل داخل مركز البيانات
مميزات رقاقة Cerebras WSE-3 في القضاء على اختناق الاتصال وزيادة سرعة الذاكرة.
الميزةWafer-Scale Engine (WSE-3)Nvidia H100 / B200
الحجم الفيزيائيأكبر بـ 57 مرة من الـ GPU القياسيشريحة صغيرة محدودة المساحة
إنتاجية المستخدم2000 – 2500 رمز/ثانية50 – 300 رمز/ثانية
شبكة الربطداخلية بالكامل (انعدام التأخير)تتطلب InfiniBand أو NVLink
💡 ملحوظة: احتواء النموذج بالكامل داخل SRAM الرقاقة يلغي ضريبة الاتصال البيني نهائياً.

4. الحل البرمجي المبتكر: البث المباشر (Zero-Copy)

​العتاد القوي يحتاج إلى كود برمجي نظيف. الاعتماد على DataLoader التقليدي لـ PyTorch يستهلك موارد المعالج. الحل الذي نقدمه هنا يعتمد على “البث المباشر من الذاكرة المقيدة صفرياً” (Zero-Copy Streaming).

مخطط توضيحي لتقنية البث المباشر لنقل البيانات من وحدات التخزين إلى المعالجات مباشرة
كيف يساهم البث المباشر في خفض العبء البرمجي بنسبة 90% عبر الذاكرة المقيدة صفرياً.

هذا الكود يقرأ البيانات من القرص مباشرة لتغذية الرقاقة، مما يخفض العبء البرمجي بنسبة 90%

كود الاستدلال المباشر (Zero-Copy)
import numpy as np; import cerebras_pytorch as cstorch
backend = cstorch.backend("CSX", artifact_dir="./easy_inference")
seq_length = 2048; mmap_features = np.memmap('all_tokens.bin', dtype=np.int32, mode='r', shape=(100000, seq_length))
def easy_zero_copy_generator(batch_size=32):
    for i in range(0, mmap_features.shape[0], batch_size):
        batch_slice = mmap_features[i:i+batch_size]
        if batch_slice.shape[0] < batch_size: break
        yield {"input_ids": cstorch.from_numpy(batch_slice), "attention_mask": cstorch.from_numpy(np.ones((batch_size, seq_length), dtype=np.int32))}
compiled_model = cstorch.compile(model, backend)
with cstorch.Session(backend) as session:
    for batch in easy_zero_copy_generator(batch_size=32): predictions = compiled_model(batch)

🛠️ تعريف النموذج

يجب تعريف متغير model قبل سطر التجميع، وإلا سيتوقف الكود.

📁 ملف البيانات

تأكد من وجود ملف all_tokens.bin في نفس مسار التشغيل لتجنب خطأ FileNotFoundError.

⚠️ بيئة التشغيل

الكود مصمم حصرياً لخوادم Cerebras CSX ولن يعمل على الأجهزة الشخصية أو المعالجات العادية.

 


5. المصاريف التشغيلية (OPEX): الفوز بالضربة القاضية

​السباق الحقيقي في خوادم الحوسبة السحابية ليس في ثمن الشراء، بل في فاتورة الكهرباء. بفضل كفاءة استهلاك الطاقة، يخفض هذا التحالف تكلفة تشغيل النماذج (Cost per Token) بشكل جذري. سعر الاستدلال التجاري الآن مع Cerebras يبلغ 10 سنتات فقط لكل مليون رمز (لنموذج Llama 8B).

​دعونا نقارن فاتورة الطاقة السنوية للمضيفين:

فاتورة الطاقة (OPEX) سنويًاAMD EPYC 9996 (2P)Intel Xeon 6980P (4P)
الاستهلاك عند الذروة1.5 كيلوواط2.6 كيلوواط
الاستهلاك السنوي (مع PUE)16,425 kWh28,470 kWh
التكلفة النهائية (0.12$/kWh)$1,971$3,416
💡 ملحوظة: خادم AMD يوفر 1,445 دولاراً سنوياً في فاتورة الكهرباء لكل عقدة مضيفة.

6. أتمتة البنية التحتية وضبط عقد NUMA

​لضمان أقصى سرعة في استدلال الذكاء الاصطناعي، يجب ضبط إعدادات الـ BIOS لتعمل بوضعية (NPS4) لتقليل زمن استجابة الذاكرة لأقل من 60 نانومتر. بدلًا من القيام بذلك يدوياً، جهزت لك سكريبت يعتمد على Redfish API لتهيئة مئات الخوادم دفعة واحدة، مع أمر لينكس لعزل العمليات التشغيلية.

أتمتة BIOS وأمر التشغيل
import requests, json
server_cluster = ["192.168.10.11", "192.168.10.12"] 
bios_payload = {"Attributes": {"NumaNodesPerSocket": "NPS4", "PcieGen6Bridge": "ForceGen6"}}
for ip in server_cluster: requests.patch(f"https://{ip}/redfish/v1/Systems/Self/Bios/Settings", json=bios_payload, auth=("admin", "pass"), verify=False)

numactl --cpunodebind=0 --membind=0 python easy_inference_wse.py

⚙️ المتطلبات وتعديل البيانات

تحتاج لتثبيت مكتبة requests، وتغيير الآيبيهات و(admin/pass) لتطابق بيانات الـ BMC الخاصة بخوادمك.

🚀 الجزء الأول: سكريبت بايثون

يتم تشغيله كملف بايثون عادي من أي جهاز على نفس الشبكة لإرسال إعدادات الـ BIOS لكل الخوادم دفعة واحدة.

💻 الجزء الثاني: أمر لينكس

بعد إعادة تشغيل الخادم، يُنفذ السطر الأخير (numactl...) داخل موجه أوامر اللينكس (Terminal) لربط المعالجة بالعقدة 0.


​7. التوسع العنقودي (Linear Scalability): نهاية معضلة النماذج التريليونية

​عند بناء نماذج ذكاء اصطناعي ضخمة تتخطى التريليون معلمة، تعاني البطاقات التقليدية من هدر كارثي في الأداء بسبب تعقيدات الربط الشبكي وتقسيم البيانات. هنا يبرز السر السابع للتحالف عبر هندسة السرب (Swarm Architecture)

مخطط بصري يوضح التوسع العنقودي وهندسة السرب لربط شرائح الذكاء الاصطناعي
كيف يساهم التوسع العنقودي في مضاعفة الإنتاجية دون هدر في الأداء.

التي تدمج عدة رقاقات WSE-3 لتعمل معاً كـ “شريحة واحدة عملاقة” تحت إدارة معالجات AMD EPYC. هذا التناغم يحقق توسعاً خطياً مثالياً؛ حيث تتضاعف القوة الإنتاجية بنسبة 100% مع كل إضافة للعتاد دون أي اختناق مروري.

🧠 هندسة السرب

ربط الرقاقات لتعمل كعقل واحد متصل لتشغيل النماذج التريليونية.

📈 توسع خطي

مضاعفة العتاد تعني مضاعفة الأداء بنسبة 100% حرفياً.

🚫 صفر هدر

إلغاء التعقيد البرمجي لتقسيم البيانات عبر الشبكات الخارجية.

كفاءة التوسع (Scaling)عناقيد Cerebras Swarmمجموعات GPUs التقليدية
هدر الأداء مع إضافة عقد جديدة0% (توسع خطي مثالي)يصل إلى 40% هدر في المزامنة
التعقيد البرمجينظام التشغيل يراه كشريحة منطقية واحدةيتطلب تقسيم هندسي (Tensor Parallelism)
💡 ملحوظة: اسحب الجدول يميناً ويساراً. التوسع الخطي يلغي ضريبة الشبكات المعتادة.

🚀 نهاية احتكار الـ GPUs

نرى في “دروع تقني” أن التفكيك المعماري (Disaggregation) سيكون المعيار الذهبي للمراكز السحابية بحلول عام 2028.

⚙️ الكفاءة البرمجية

العتاد الخارق لا قيمة له دون كود نظيف؛ دمج حلول الـ Zero-Copy يثبت أن السوفت وير هو الروح التي تحرك العتاد.


الأسئلة الشائعة (FAQ)

لماذا وضع NPS4 مهم جداً لمعالجات AMD؟

لأنه يقسم المعالج ذو الـ 256 نواة إلى 4 عقد مادية، مما يربط الأنوية بالذاكرة الأقرب لها ويمنع تأخير نقل البيانات للرقاقة.

كيف ألغى Cerebras ضريبة الاتصال البيني؟

عبر وضع النموذج بالكامل (حتى 44 جيجابايت) داخل الذاكرة المدمجة للشريحة، مما ألغى الحاجة لتقطيع البيانات عبر شبكات خارجية مبطئة.

ما هو البث المباشر (Zero-Copy)؟

هو تقنية برمجية تقرأ البيانات من القرص الصلب مباشرة إلى الرقاقة دون نسخها عشوائياً في الذاكرة المركزية، مما يقلل الحمل على الـ CPU بنسبة 90%.


تابع صفحتنا الرسمية على فيسبوك

احصل على أحدث الأخبار والتحليلات التقنية مباشرة في صفحتك

تابعنا الآن
دروع تقني

دروع تقني

"محرر صحفي، ومالك وكالة CAT ودرع تقني. متخصص في متابعة وتحليل أحدث التقنيات العالمية والذكاء الاصطناعي."

أضف تعليق

dro3tech
لمحة عامة عن الخصوصية

يستخدم موقعنا ملفات تعريف الارتباط (Cookies) لتحسين تجربة التصفح الخاصة بك، وتقديم محتوى إخباري مخصص، وتحليل حركة المرور لدينا لتزويدك بأفضل خدمة ممكنة.

يمكنك ضبط وتخصيص جميع إعدادات ملفات تعريف الارتباط الخاصة بك من خلال الانتقال بين التبويبات الموجودة على الجانب.