التعلم المعزز من ردود الفعل البشرية (RLHF)

RLHF

تعريف

التعلم التعزيزي من التغذية الراجعة البشرية (RLHF) هو أسلوب لمواءمة نماذج الذكاء الاصطناعي مع القيم الإنسانية من خلال دمج الأحكام البشرية في عملية التدريب. ويُستخدم غالبًا لضبط نماذج اللغات الكبيرة.

الهدف

الهدف هو جعل مخرجات الذكاء الاصطناعي أكثر أمانًا وفائدةً وتوافقًا مع تفضيلات الإنسان. يُحسّن RLHF أنظمة المحادثة من خلال الحد من الاستجابات الضارة أو المتحيزة أو غير ذات الصلة.

أهمية

  • يوفر إشرافًا بشريًا في تدريب الذكاء الاصطناعي.
  • تحسين موثوقية أنظمة الذكاء الاصطناعي.
  • يتطلب عمالة مكثفة بسبب احتياجات التوضيح البشري.
  • متعلق ببحوث نمذجة التفضيلات والمحاذاة.

كيف تعمل هذه التقنية؟

  1. جمع ردود الفعل البشرية من خلال مقارنة مخرجات النموذج.
  2. تدريب نموذج المكافأة على التفضيلات البشرية.
  3. استخدم التعلم المعزز لضبط النموذج الأساسي.
  4. تقييم الأداء مقابل أهداف التوافق.
  5. كرر ذلك مع التعليقات الإضافية.

أمثلة (العالم الحقيقي)

  • OpenAI ChatGPT: تم ضبطه باستخدام RLHF لتحقيق استجابات أكثر أمانًا.
  • الذكاء الاصطناعي الدستوري لـ Anthropic: يسترشد بالمبادئ بدلاً من ردود الفعل المباشرة.
  • InstructGPT: نموذج OpenAI المبكر الذي يوضح RLHF.

المراجع / قراءات إضافية

أخبرنا كيف يمكننا مساعدتك في مبادرتك التالية للذكاء الاصطناعي.