تقنيات

التعلّم المعزّز بالتغذية البشرية

RLHF
يُعرف أيضاً بـ: Reinforcement Learning from Human Feedback

تحسين النموذج عبر تفضيلات بشرية: المراجعون يختارون الإجابة الأفضل فيتعلّم منهم.

الشرح التفصيلي

RLHF هو السر الذي حوّل GPT الخام إلى ChatGPT المهذّب: مراجعون بشريون يقارنون إجابتين ويختارون الأفضل، فيتعلّم النموذج اتباع نبرة وقيم وأسلوب البشر. أساس مواءمة كل النماذج التجارية الكبرى.

مصطلحات ذات صلة

الدورة المرتبطة بهذا المحتوى

أساسيات الذكاء الاصطناعي

نقطة البداية الصحيحة: المفاهيم، الحدود، والتطبيق العملي بلا تعقيد.

ابدأ مسار أساسيات الذكاء الاصطناعي