RLHF (Reinforcement Learning from Human Feedback)
טכניקה לאימון מודלי AI באמצעות משוב אנושי — בני אדם מדרגים תשובות של המודל, והמודל לומד להעדיף תשובות שבני אדם מעריכים יותר. השיטה שהפכה את ChatGPT למוצלח.
קטגוריות: בינה מלאכותית (AI) · פיתוח תוכנה ו-Web