یادگیری تقویتی چیست؟ در یک تعریف ساده یادگیری تقویتی (RL)، علم تصمیمگیری است. این علم در مورد یادگیری رفتار بهینه در یک محیط برای به دست آوردن حداکثر پاداش، اطلاعاتی کاربردی به ما میدهد. این رفتار بهینه از طریق تعامل با محیط و مشاهده نحوه پاسخ آن شکل میگیرد. مشابه رفتار کودکانی که دنیای اطراف خود را جستجو میکنند و اقداماتی را که به آنها در دستیابی به یک هدف کمک خواهد کرد، یاد میگیرند.
در غیاب ناظر، یادگیرنده باید بهطور مستقل توالی اقداماتی را کشف کند که پاداش را به حداکثر میرسانند. این فرآیند کشف شبیه به جستجوی آزمون و خطا است. کیفیت اقدامات نه تنها با پاداش فوری که بهدست میآورند، بلکه با پاداش تاخیری که ممکن است بهدست آورند نیز سنجیده میشود. از آنجایی که یادگیری تقویتی میتواند اقداماتی را که منجر به موفقیت نهایی در یک محیط ناشناخته میشوند، بدون کمک ناظر یاد بگیرد یک الگوریتم بسیار قدرتمند است.
تفاوت با یادگیری نظارتشده و بدون نظارت
با توجه به اینکه یادگیری تقویتی از طریق تعامل با محیط و آزمونوخطا انجام میشود، بازخورد معمولا با تاخیر، پراکنده و بهصورت پاداش خواهد بود. چون هدف اصلی یادگیری خطمشی (Policy) بهینه برای تصمیمگیری متوالی و بلند مدت است. با این وصف تفاوت آن با یادگیری نظارت شده و بدون نظارت به این ترتیب خواهد بود: