ضغط النماذج
ضغط النماذج هو مجموعة من التقنيات المصممة لتقليل حجم ومتطلبات الذاكرة والحوسبة لنماذج الذكاء الاصطناعي مع الحفاظ على دقتها التنبؤية وأدائها العام. يقوم المبدأ الأساسي لضغط النماذج على أن الشبكات العصبية الكبيرة تحتوي على تكرار كبير في معاملاتها وأن هذا التكرار يمكن استغلاله لإنشاء نماذج أصغر وأسرع دون تدهور كارثي في جودة المخرجات. تشمل تقنيات الضغط الأكثر شيوعاً التكميم، الذي يقلل الدقة العددية لأوزان النموذج من الفاصلة العائمة 32 بت إلى تنسيقات أقل مثل الأعداد الصحيحة 8 بت أو حتى 4 بت والتمثيل الثنائي؛ والتقليم، الذي يزيل بشكل منهجي الأوزان أو الخلايا العصبية أو الطبقات الأقل أهمية من الشبكة بناءً على حجمها أو مقاييس مساهمتها؛ وتقطير المعرفة، حيث يتم تدريب نموذج طالب مضغوط لتقليد سلوك نموذج معلم أكبر، مما ينقل تمثيلات المعلم المكتسبة إلى بنية أكثر كفاءة؛ ومشاركة الأوزان، التي تجمع قيماً متعددة للأوزان المتميزة في مجموعة أصغر من القيم المشتركة المخزنة مرة واحدة والمشار إليها عدة مرات. يمكن تطبيق هذه التقنيات بشكل فردي أو مجتمعة، وغالباً ما تحقق نسب ضغط تتراوح بين 4x إلى 10x أو أكثر مع تدهور ضئيل في الدقة يقاس بكسور النسبة المئوية. يعتمد اختيار طرق الضغط المناسبة على بيئة النشر المحددة، وهندسة الأجهزة المستهدفة، والهندسة الأصلية للنموذج، والمفاضلة المقبولة بين تقليل الحجم والحفاظ على الأداء. قد تجمع خطوط أنابيب الضغط المتقدمة بين تقنيات متعددة بشكل تسلسلي، مثل التقليم متبوعاً بالتكميم ثم التقطير، لتحقيق فوائد تراكمية. يستمر مجال ضغط النماذج في التطور بسرعة، مع ظهور تقنيات جديدة مثل البحث في الهندسة المعمارية العصبية، والتحليل منخفض الرتبة، والتقليم المنظم كنهج تكميلية. بالنسبة للنشر في الإنتاج، يتم دمج ضغط النماذج عادةً في خط أنابيب عمليات التعلم الآلي كخطوة قياسية قبل النشر، مع التحقق الدقيق لضمان أن النماذج المضغوطة تلبي معايير الدقة والموثوقية.
في الخدمات المالية
مثال واقعي
قرر بنك إقليمي أوروبي متوسط الحجم يعمل في فرنسا وألمانيا وإسبانيا نشر نموذج لغة كبير للمراجعة الآلية لوثائق الامتثال عبر قسم الخدمات المصرفية للأفراد. يتكون مركز البيانات المحلي للبنك من خوادم Intel Xeon قياسية بسعة 64 جيجابايت من ذاكرة الوصول العشوائي لكل عقدة وبدون تسريع GPU، حيث أن دورة شراء الأجهزة المتخصصة للبنك هي ثمانية عشر شهراً وقد تم بالفعل تخصيص ميزانية السنة المالية الحالية. يحتاج فريق الامتثال إلى معالجة حوالي 10000 وثيقة يومياً، بما في ذلك الإيداعات التنظيمية ومراسلات العملاء ووثائق السياسة الداخلية، واستخراج المعلومات الرئيسية والإبلاغ عن مشكلات الامتثال المحتملة. يقوم فريق علوم البيانات في البنك بتقييم العديد من نماذج اللغات الكبيرة مفتوحة المصدر ويختار نموذجاً من 7 مليارات معامل كهندسة أساسية. بدون ضغط، يتطلب هذا النموذج حوالي 28 جيجابايت من الذاكرة بدقة 32 بت كاملة ويستغرق 12 ثانية لكل استدلال على أجهزة CPU المتاحة. يطبق الفريق تكميم int-8، مما يقلل بصمة ذاكرة النموذج إلى 7 جيجابايت، ثم يطبق تقليماً غير منظم بنسبة 50% لإزالة الأوزان الأقل أهمية، مما يقلل الحجم إلى 3.5 جيجابايت. أخيراً، يطبقون تقطير المعرفة، وتدريب نموذج طالب أصغر من 3 مليارات معامل على مخرجات النموذج المعلم المكمم والمقلم. يشغل النموذج المضغوط النهائي 2.8 جيجابايت فقط من الذاكرة، ويجري الاستدلال في 800 مللي ثانية لكل مستند على خوادم CPU الحالية، ويحقق 98.7% من دقة النموذج الأصلي في مهام تصنيف الامتثال.
لماذا يهم في التمويل
ضغط النماذج مهم بعمق للصناعة المالية لأنه يعالج مباشرة التوتر بين قدرة الذكاء الاصطناعي وإمكانية الوصول إلى البنية التحتية. تتطلب نماذج الذكاء الاصطناعي الأكبر والأكثر قدرة موارد حوسبة هائلة لا تتوفر إلا من خلال مزودي الخدمات السحابية أو الأجهزة المتخصصة، مما يخلق فجوة بين المؤسسات التي يمكنها تحمل تكاليف هذه البنية التحتية وتلك التي لا تستطيع. تقنيات الضغط تسوي هذا الملعب، مما يسمح للمؤسسات الأصغر بنشر قدرات ذكاء اصطناعي تنافسية على الأجهزة الحالية. هذا مهم بشكل خاص في الخدمات المالية، حيث تفرض لوائح سيادة البيانات غالباً النشر في الموقع وحيث تكون ميزانيات تكنولوجيا المعلومات مقيدة بمتطلبات رأس المال التنظيمي. بالنسبة لموردي التكنولوجيا المالية ومطوري البرمجيات، يتيح ضغط النماذج دمج قدرات الذكاء الاصطناعي مباشرة في منتجاتهم دون مطالبة العملاء بتوفير بنية تحتية متخصصة. هذا يوسع السوق القابلة للعنونة للبرمجيات المالية المدعومة بالذكاء الاصطناعي ويسرع اعتماد الأتمتة الذكية عبر الصناعة. من منظور إدارة المخاطر، النماذج المضغوطة التي تعمل في الموقع تقلل من سطح الهجوم لسرقة البيانات وتلغي الحاجة إلى نقل البيانات المالية الحساسة عبر الشبكات إلى نقاط نهاية الاستدلال السحابية. هذه ميزة كبيرة للامتثال للوائح حماية البيانات مثل اللائحة العامة لحماية البيانات في الأطر المماثلة في الشرق الأوسط وآسيا. علاوة على ذلك، تدعم مكاسب كفاءة الطاقة من ضغط النماذج التزامات الاستدامة للمؤسسات المالية، والتي ترتبط بشكل متزايد بمتطلبات الإبلاغ التنظيمي وتوقعات أصحاب المصلحة. مع استمرار نماذج الذكاء الاصطناعي في النمو من حيث الحجم والقدرة، ستزداد أهمية تقنيات الضغط فقط، مما يجعلها مكوناً أساسياً في أي استراتيجية نشر للذكاء الاصطناعي لمؤسسة مالية.
مصطلحات ذات صلة
استكشف في Finatune
أسئلة شائعة
ما هو ضغط النماذج في الذكاء الاصطناعي؟
ضغط النماذج هو مجموعة من التقنيات التي تقلل حجم ومتطلبات الحوسبة لنماذج الذكاء الاصطناعي مع الحفاظ على الدقة. الطرق الرئيسية هي التكميم والتقليم وتقطير المعرفة، والتي يمكن أن تقلل حجم النموذج من 4 إلى 10 مرات مع فقدان ضئيل في الدقة.
كيف يساعد ضغط النماذج المؤسسات المالية على نشر الذكاء الاصطناعي بشكل أسرع؟
يتيح ضغط النماذج للمؤسسات المالية تشغيل نماذج الذكاء الاصطناعي على خوادم CPU الحالية دون الحاجة إلى أجهزة GPU باهظة الثمن. هذا يلغي الحاجة إلى دورات شراء الأجهزة المتخصصة التي تستغرق 12 إلى 18 شهراً.
ما هي أفضل تقنيات الضغط للذكاء الاصطناعي المالي في الموقع؟
أفضل التقنيات تعتمد على حالة الاستخدام. التكميم يقلل بصمة الذاكرة 4 مرات مع فقدان ضئيل في الدقة. التقليم فعال لإزالة المعاملات الزائدة. تقطير المعرفة قيم للتطبيقات في الوقت الفعلي. مزيج من الثلاثة يعطي أفضل النتائج.