تقنيات
التعلّم المعزّز بالتغذية البشرية
RLHF
يُعرف أيضاً بـ: Reinforcement Learning from Human Feedback
تحسين النموذج عبر تفضيلات بشرية: المراجعون يختارون الإجابة الأفضل فيتعلّم منهم.
الشرح التفصيلي
RLHF هو السر الذي حوّل GPT الخام إلى ChatGPT المهذّب: مراجعون بشريون يقارنون إجابتين ويختارون الأفضل، فيتعلّم النموذج اتباع نبرة وقيم وأسلوب البشر. أساس مواءمة كل النماذج التجارية الكبرى.
مصطلحات ذات صلة
تعلّم الذكاء الاصطناعي بالعربية
مسارات تدريبية مجانية تبدأ من الصفر وتنتهي بشهادة إتمام.
استعرض المسارات