ThemeJunction SAAS

یادگیری تقویتی چیست؟ در یک تعریف ساده یادگیری تقویتی (RL)، علم تصمیم‌گیری است. این علم در مورد یادگیری رفتار بهینه در یک محیط برای به دست آوردن حداکثر پاداش، اطلاعاتی کاربردی به ما می‌دهد. این رفتار بهینه از طریق تعامل با محیط و مشاهده نحوه پاسخ آن شکل می‌گیرد. مشابه رفتار کودکانی که دنیای اطراف خود را جستجو می‌کنند و اقداماتی را که به آنها در دستیابی به یک هدف کمک خواهد کرد، یاد می‌گیرند.

در غیاب ناظر، یادگیرنده باید به‌طور مستقل توالی اقداماتی را کشف کند که پاداش را به حداکثر می‌رسانند. این فرآیند کشف شبیه به جستجوی آزمون و خطا است. کیفیت اقدامات نه تنها با پاداش فوری که به‌دست می‌آورند، بلکه با پاداش تاخیری که ممکن است به‌دست آورند نیز سنجیده می‌شود. از آنجایی که یادگیری تقویتی می‌تواند اقداماتی را که منجر به موفقیت نهایی در یک محیط ناشناخته می‌شوند، بدون کمک ناظر یاد بگیرد یک الگوریتم بسیار قدرتمند است.

تفاوت با یادگیری نظارت‌شده و بدون نظارت

با توجه به اینکه یادگیری تقویتی از طریق تعامل با محیط و آزمون‌وخطا انجام می‌شود، بازخورد معمولا با تاخیر، پراکنده و به‌‌صورت پاداش خواهد بود. چون هدف اصلی یادگیری خط‌مشی (Policy) بهینه برای تصمیم‌گیری متوالی و بلند مدت است. با این وصف تفاوت آن با یادگیری نظارت ‌شده و بدون نظارت به این ترتیب خواهد بود:

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *