vLLM
محرك استدلال عالي الإنتاجية للنماذج اللغوية

تعالج vLLM اختناق الموارد الحاسوبية عند نشر النماذج اللغوية الكبيرة على نطاق واسع. تتطلب النماذج الحديثة ذاكرة وقدرات حوسبة كبيرة، ما يجعل الاستدلال العملي مكلفًا وبطيئًا. تتيح آلية الانتباه المحسّنة والتجميع الديناميكي في vLLM تشغيل النماذج بسرعة أكبر وبتكلفة أقل مقارنة بالأساليب التقليدية.
أبرز الميزات
- تعمل تقنية PagedAttention على افتراضية ذاكرة التخزين المؤقت لأزواج المفاتيح والقيم في آلية الانتباه لتقليل استهلاك ذاكرة GPU
- يزيد التجميع المستمر وجدولة الطلبات من استغلال GPU والإنتاجية
- يدعم أكثر من 200 بنية نموذج، بما فيها النماذج متعددة الوسائط ونماذج مزيج الخبراء
- تكامل سلس مع Hugging Face بأقل قدر من التعديلات البرمجية
- متوافق مع وحدات GPU من NVIDIA وAMD، ومعالجات Intel والمنصات العتادية الناشئة
- يتضمن REST API متوافقًا مع OpenAI لتسهيل النشر
سواء كنت باحثًا ينشئ نماذج أولية، أو مهندس تعلم آلي ينشر أحمال الاستدلال في بيئة إنتاجية، أو مؤسسة تسعى إلى خفض التكاليف، توفر vLLM المرونة والأداء معًا. المشروع مفتوح المصدر بالكامل ومجاني الاستخدام، ما يجعل الاستدلال بمستوى المؤسسات متاحًا للفرق بجميع أحجامها.
أدوات مشابهة
عرض البدائل →LM Studio
مجانيشغّل نماذج اللغة مفتوحة المصدر محليًا ومن دون اتصال
أدوات البرمجةأدوات الإنتاجية
Llama
مجانينموذج Meta اللغوي المجاني ومفتوح المصدر للمطورين
أدوات البرمجةروبوتات المحادثة
Langfuse
مجاني بميزات مدفوعةمراقبة تطبيقات LLM وتتبعها وتقييمها في بيئة الإنتاج
أدوات البرمجةعمليات الأتمتة والوكلاء
التعليقات(0)
سجّل الدخول للتعليق