QF-Tradernet: تجارت داخل دهانه از طریق تقویت عمیق با سطح کوانتومی قیمت مبتنی بر کنترل سود و از دست دادن

ساخت وبلاگ

Yifu Qiu ، Yitao Qiu ، Yicong Yuan ، Zheng Chen and Raymond Le*

  • گروه علوم و فناوری رایانه ، بخش علوم و فناوری ، کالج بین المللی BNU-HKBU یونایتد ، ژوهای ، چین

تجارت مبتنی بر یادگیری تقویت (RL) مبتنی بر علاقه مندی غنی از علاقه را به خود جلب می کند. با این حال ، در تحقیقات موجود ، RL در کار تجارت روزانه از جنبش مالی پر سر و صدا در مقیاس زمانی کوتاه ، مشکل در ترتیب تسویه حساب و جستجوی اقدام گران قیمت در یک فضای با ارزش مداوم رنج می برد. در این مقاله یک عامل بازرگانی RL نهایی RL ، یعنی QF-Madeet ، بر اساس نظریه مالی کوانتومی (QFT) و یادگیری عمیق تقویت شده است. ما یک طرح جدید برای فضای اقدام Trader Intraday RL ، با الهام از سطح قیمت کوانتومی (QPL) ارائه دادیم. طراحی فضای اکشن ما همچنین این مدل را یک استراتژی کنترل سود و از دست دادن قابل یادگیری به ارمغان می آورد. QF-Tradeet دو شبکه عصبی را تشکیل می دهد: 1) شبکه های حافظه کوتاه مدت کوتاه برای یادگیری ویژگی های سری زمانی مالی. 2) یک شبکه ژنراتور خط مشی (PGN) برای تولید توزیع اقدامات. سودآوری و استحکام QF-tradeet در مجموعه داده های مالی چند نوع ، از جمله فارکس ، فلزات ، نفت خام و شاخص های مالی تأیید شده است. نتایج تجربی نشان می دهد که QF-tradeet از سایر خطوط دیگر از نظر بازده قیمت تجمعی و نسبت شارپ و استحکام در تغییر بازار محرک بهتر عمل می کند.

1. معرفی

تجارت مالی یک فرایند تصمیم گیری آنلاین است (دنگ و همکاران ، 2016). آثار قبلی (مودی و Saffell ، 1998 ؛ مودی و Saffell ، 2001 ؛ Dempster and Leemans ، 2006) نشان داد که سودآوری امیدوار کننده یادگیری تقویت کننده (RL) در فعالیت های تجاری است. با این حال ، الگوریتم های RL سنتی از سه جنبه برای مشکل تجارت داخل کشور با چالش هایی روبرو هستند: 1) جنبش مالی کوتاه مدت اغلب با نوسانات پر سروصدا همراه است. 2) پیچیدگی محاسباتی برای تصمیم گیری در محدوده قیمت مداوم روزانه. در استراتژی T + N ، به عوامل RL در هر روز معاملاتی موقعیت طولانی ، بی طرف یا کوتاه اختصاص داده می شود ، از جمله شبکه های عصبی مکرر عمیق فازی (FDRNN) (دنگ و همکاران ، 2016) و یادگیری تقویت مستقیم (DRL) (DRL) (DRL) (DRL) (DRL)مودی و سافل ، 2001). با این حال ، در تجارت روز ، یعنی استراتژی t + 0 ، وظیفه تجارت برای شناسایی قیمت بهینه برای باز و بستن سفارش تبدیل می شود. 3) توقف اولیه سفارشات هنگام استفاده از استراتژی Intraday. به طور معمول ، تسویه حساب شامل دو hyperparameter: سود هدف (TP) و متوقف کردن ضرر (SL). TP به قیمت بسته شدن سفارش فعال کننده اشاره دارد و در صورت جابجایی قیمت همانطور که انتظار می رود ، سود را به دست می آورید. SL نشان می دهد که قیمت برای خاتمه معامله و جلوگیری از ضرر بیشتر در صورت حرکت به سمت جهت ضرر (به عنوان مثال ، قیمت پس از تصمیم موقعیت طولانی کاهش یافته است). این دو hyperparameter به عنوان یک تغییر ثابت نسبت به قیمت برای ورود به بازار تعریف می شوند ، همانطور که به عنوان امتیاز معروف است. اگر قیمت این سطح دو قسمت را لمس کند ، سفارش به صورت قطعی بسته می شود. نمونه ای از ترتیب اولیه در شکل 1 نشان داده شده است.

www.frontiersin.org

شکل 1 . یک مشکل از دست دادن زودرس: یک سفارش کوتاه زود حل می شود (خط قرمز رنگ: SL) قبل از اینکه قیمت به محدوده سودآور کاهش یابد. بنابراین ، این استراتژی سود بالقوه (فلش دوتایی آبی) را از دست می دهد.

با تمرکز بر چالش های ذکر شده ، ما یک مدل یادگیری پایان به پایان به یادگیری مبتنی بر یادگیری عمیق ، به نام QF-Tradeet را پیشنهاد کردیم. مدل ما مستقیماً خط مشی معاملاتی را برای کنترل سود و زیان به جای استفاده از TP و SL ثابت ایجاد می کند. QF-Madeet شامل دو شبکه عصبی با عملکردهای مختلف است: 1) شبکه های حافظه کوتاه مدت (LSTM) برای استخراج ویژگی زمانی در سری زمانی مالی. 2) یک شبکه تولید کننده خط مشی (PGN) برای تولید توزیع اقدامات (خط مشی) در هر ایالت. ما به خصوص به سطح قیمت کوانتومی (QPLS) اشاره می کنیم که در شکل 2 نشان داده شده است تا فضای عمل را برای عامل RL طراحی کند ، بنابراین فضای ارزش قیمت را گسسته می کند. روش ما از تئوری مالی کوانتومی الهام گرفته شده است که QPLS حالت تعادل حرکت قیمت را به صورت روزانه ضبط می کند (لی ، 2020). ما از الگوریتم یادگیری عمیق تقویت شده برای به روزرسانی پارامترهای قابل آموزش QF-Madeet به طور تکراری برای به حداکثر رساندن بازده قیمت تجمعی استفاده می کنیم.

www.frontiersin.org

شکل 2 . تصویر QPL های AUDUSD در 3 روز معاملاتی متوالی (23/04/2020 27/04/2020) در نمودار K-Line 30 دقیقه. خطوط آبی نشانگر QPL های منفی بر اساس حالت زمین (خط خط سیاه) است. خطوط قرمز QPL های مثبت هستند. رنگ خط با افزایش سطح QPL n عمیق تر می شود.

آزمایش در مجموعه داده های مختلف مالی ، از جمله شاخص های مالی ، فلزات ، نفت خام و فارکس ، و مقایسه با سیستم های تجاری قبلی RL و DL مبتنی بر DL انجام شده است. QF-Madeet ما از برخی از خطوط پیشرفته در سودآوری ارزیابی شده توسط بازده تجمعی و بازده تنظیم شده ریسک (نسبت شارپ) و استحکام با تلاطم بازار بهتر عمل می کند. مدل ما سازگاری را در محیط بازار غیب نشان می دهد. سیاست تولید شده QF-Madeet همچنین یک استراتژی کنترل سفارش سود و از دست دادن قابل توضیح را ارائه می دهد.

مشارکتهای اصلی ما می تواند خلاصه شود:

• ما یک مدل DayTrade پایان تا پایان را پیشنهاد می کنیم که مستقیماً سطح قیمت بهینه را برای حل و فصل می آموزد ، بنابراین توقف اولیه را در یک تنظیم ضمنی از دست دادن و انتفاعی هدف حل می کنیم.

• ما اولین کسی هستیم که فضای عمل RL را از طریق سطح قیمت کوانتومی روزانه ارائه می دهیم و تجارت روز دستگاه را قابل ردیابی می کند.

• تحت همان ادراک اطلاعات بازار ، ما نسبت به مدلهای قبلی مبتنی بر RL پیشرفته ، به سودآوری و استحکام بهتری می رسیم.

2 کار مرتبط

کار ما مطابق با دو کار فرعی است: استخراج ویژگی های مالی و معاملات مبتنی بر یادگیری تقویت عمیق. ما به زودی مطالعات گذشته را مرور می کنیم.

2. 1 استخراج و نمایندگی ویژگی های مالی

رویکردهای محاسباتی برای برنامه های کاربردی در مدل سازی مالی در گذشته مورد توجه بسیاری قرار گرفته است.(Peralta and Zareei ، 2016). از مدل شبکه برای انجام برنامه ریزی و انتخاب نمونه کارها استفاده کرد. Giudici و همکاران.(2021) از روشهای تجزیه سرریز نوسانات برای مدل سازی روابط بین دو ارز استفاده کرد. Resta و همکاران.(2020) یک رویکرد مبتنی بر تجزیه و تحلیل فنی را برای شناسایی فرصت های تجارت با خاص در Cryptocurrency انجام داد. در میان اینها ، شبکه های عصبی توانایی امیدوار کننده در یادگیری داده های ساختار یافته و بدون ساختار را نشان می دهد. بسیاری از آثار مرتبط در مدل سازی مالی عصبی به رابطه تعبیه شده (لی و همکاران ، 2019) و پیش بینی (وی و همکاران ، 2017) ، قیمت گذاری گزینه (Pagnottoni ، 2019) و پیش بینی (Neely et al. ، Neely et al. 2014). شبکه های حافظه کوتاه مدت طولانی مدت (LSTM) (Wei et al. ، 2017) ، شبکه های عصبی مکرر المان (وانگ و همکاران ، 2016) در کارهای تجزیه و تحلیل سری زمانی مالی با موفقیت به کار گرفته شدند. ترن و همکاران.(2018) از مکانیسم توجه برای اصلاح RNN استفاده کرد.(Mohan et al. ، 2019). برای تقویت عملکرد پیش بینی سهام ، هم از اطلاعات بازار و هم در متنی استفاده کرد. برخی از مطالعات همچنین تعبیه سهام را برای معدن شاخص های وابستگی اتخاذ کرده اند (چن و همکاران ، 2019).

2. 2 یادگیری تقویت در تجارت

تجارت الگوریتمی به طور گسترده ای در زیر حوزه های مختلف آن، از جمله کنترل ریسک (Pichler et al., 2021)، بهینه سازی پورتفولیو (Giudici و همکاران، 2020)، و استراتژی معاملات (Marques and Gomes، 2010؛ Vella and Ng، 2015) مورد مطالعه قرار گرفته است. چن و همکاران، 2021). امروزه، تجارت مبتنی بر هوش مصنوعی، به ویژه، رویکرد یادگیری تقویتی، هم در دانشگاه و هم در صنعت مورد توجه قرار گرفته است. مودی و سافل (2001) یک الگوریتم تقویت مستقیم را برای تجارت پیشنهاد کردند و یک مقایسه جامع بین یادگیری Q با گرادیان خط مشی انجام دادند. هوانگ و همکاران(2016) علاوه بر این، یک عامل تجاری قوی مبتنی بر شبکه های Q عمیق (DQN) پیشنهاد می کند. دنگ و همکاران(2016) از منطق فازی با یک مدل یادگیری عمیق برای استخراج ویژگی مالی از سری های زمانی پر سر و صدا استفاده کرد که به عملکرد پیشرفته ای در تجارت تک محصولی دست یافت. شیونگ و همکاران(2018) از گرادیان سیاست قطعی عمیق (DDPG) بر اساس چارچوب استاندارد بازیگر منتقد برای انجام معاملات سهام استفاده کرد. آزمایش ها سودآوری خود را در خطوط پایه از جمله روش تخصیص پورتفولیو واریانس حداقل و رویکرد فنی بر اساس شاخص میانگین صنعتی داوجونز (DJIA) نشان دادند. وانگ و همکاران(2019) از الگوریتم RL برای ساخت سبد برنده و بازنده استفاده کرد و در استراتژی خرید-برنده-فروش-بازنده معامله کرد. با این حال، وظایف معاملات روزانه برای عامل معاملاتی تقویت شده هنوز کمتر مورد توجه قرار می گیرد، که عمدتاً به دلیل پیچیدگی در طراحی فضای معاملاتی برای استراتژی معاملاتی مکرر است. ما عمدتاً در تحقیقات خود به تجارت کارآمد درون روزی می پردازیم.

3 QF-TraderNet

Daytrade به استراتژی گرفتن موقعیت و خروج از بازار در یک روز معاملاتی اشاره دارد. ما به مدل ما اجازه می دهیم زمانی که بازار در هر روز معاملاتی باز می شود، سفارش ارسال کند. بر اساس محیط مشاهده شده، ما QF-TraderNet را آموزش می دهیم تا QPL بهینه را برای تسویه یاد بگیرد. جستجوی فضای عمل مبتنی بر QPL و معماری مدل را به طور جداگانه معرفی خواهیم کرد.

3. 1 جستجوی فضای عمل مبتنی بر نظریه مالی کوانتومی

نظریه مالی کوانتومی در رابطه بین بازار مالی ثانویه و مدل مکانیک کلاسیک-کواانتوم (لی ، 2020) (منگ و همکاران ، 2015) توضیح داده شده است (Ye and Huang ، 2008). QFT یک مدل نوسان ساز Anharmonic را برای تعبیه ارتباطات بین محصولات مالی پیشنهاد می کند. این در نظر دارد پویایی محصولات مالی تحت تأثیر میدان انرژی تولید شده توسط خود و سایر محصولات مالی قرار دارد (لی ، 2020). سطح انرژی حاصل از میدان ذرات ، حالت تعادل حرکت قیمت را به صورت روزانه تنظیم می کند ، که به عنوان سطح قیمت کوانتومی روزانه (QPL) ذکر شده است. QPL ها را می توان به عنوان پشتیبانی یا مقاومت در تحلیل مالی کلاسیک در واقع مشاهده کرد. مطالعات گذشته (لی ، 2019) نشان داده اند که QPL ها می توانند به عنوان استخراج ویژگی برای سری زمانی مالی استفاده شوند. روش محاسبه QPL با مراحل زیر ارائه شده است.

مرحله 1: مدل سازی انرژی بالقوه حرکت بازار از طریق چهار شرکت کننده اصلی بازار

یکسان با مکانیک کوانتومی کلاسیک ، همیلتون در QFT حاوی اصطلاح بالقوه و اصطلاح نوسانات است. شرکت کنندگان در بازار اولیه که بر اساس تجزیه و تحلیل مالی متعارف تأسیس شده اند ، شامل 1) سرمایه گذار ، 2) دلال ، 3) داوری ، 4) پرچین و 5) سازنده بازار است. با این حال ، هیچ فرصتی در دسترس برای ArbitRager برای انجام معاملات مؤثر با توجه به فرضیه کارآمد بازار وجود ندارد (لی ، 2020). بنابراین ما اثر داوری ها را نادیده می گیریم ، و سپس تأثیر سایر شرکت کنندگان را در محاسبه اصطلاح بالقوه بازار حساب می کنیم:

سازندگان بازار خدمات تسهیلگر را برای سایر شرکت کنندگان ارائه می دهند و تقاضای برجسته ای را که به عنوان Z ذکر شده است ، جذب می کنندσ، با فاکتورهای جذب ασبشربنابراین ، تقاضای اضافی در هر نمونه توسط δ z = z داده می شود+- Zبشررابطه بین بازده های فوری r (t) = r (t ، Δ t) = p (t) - p (t - Δ t) p (t - Δ t) ، و تقاضای اضافی می تواند تقریباً به عنوان r (t ذکر شود.) = Δ z γ ، که در آن γ نشان دهنده عمق بازار است. برای یک بازار کارآمد با محیط صاف بازار ، فرض می کنیم که جذب سفارشات موجود با جهت های مختلف معاملات یکسان خواهد بود و سهم سازندگان بازار به عنوان (لی ، 2020) حاصل می شود.

جایی که σ موقعیت معاملات را از جمله +: موقعیت طولانی و -: موقعیت کوتاه نشان می دهد. حرفحرفاحترام به بازده همزمان به زمان t را نشان می دهد.

دلالان شرکت کنندگان در حال پیگیری هستند و حواس کمی در مورد کنترل ریسک دارند. رفتار آنها عمدتاً با اصطلاح نوسان ساز پویا به حرکت بازار کمک می کند. یک متغیر میرایی δ برای نشان دادن مقاومت رفتارهای دنبال کننده روند نسبت به بازار تعریف شده است. با توجه به اینکه دلالان کمتر ریسک را در نظر می گیرند ، هیچ اصطلاح آنارمونیک مرتبه بالا در مورد نوسانات بازار وجود ندارد

سرمایه گذاران احساس متوقف کردن ضرر دارند. آنها 1) سود حاصل از روند ، 2) به حداقل رساندن ریسک هستند. بنابراین ، ما انرژی بالقوه آنها را توسط ، تعریف می کنیم.

که در آن δ ، V برای اصطلاح پویا هارمونیک (روند زیر مشارکت) قرار دارد. و اصطلاح Anharmonic (نوسانات بازار).

Hedger همچنین خطر را کنترل می کند اما با استفاده از تکنیک های پیشرفته محافظت. معمولاً ، جهت تجارت معکوس توسط Hedgers در مقایسه با سرمایه گذاران مشترک ، به ویژه برای استراتژی محافظت از یک محصول انجام شده است. از این رو ، پویا بازار ناشی از پرچین می تواند خلاصه شود ،

برای نتیجه گیری معادلات (3. 1) از (3. 4) ، بازده قیمت همزمان DR/DT را می توان بازنویسی کرد ،

جایی که P تعداد انواع شرکت کنندگان را در بازارها نشان می دهد. δ ، و V در Eq. 5 خلاصه هر اصطلاح در تمام مدلهای شرکت کنندگان ، یعنی δ = γαمگنی+ δچرند+ δHG- δمن، و v = vHG- vمنبشرترکیب DR / DT با بازده قیمت براون که توسط معادله لانژوین شرح داده شده است ، انرژی پتانسیل آنی با معادله زیر مدل می شود ،

جایی که η عامل نیروی میرایی بازار است.

مرحله 2: مدل سازی اصطلاح جنبشی حرکت بازار از طریق بازده قیمت

یک چالش برای مدل سازی اصطلاح جنبشی جایگزین کردن جابجایی ها در ذرات کلاسیک با اندازه گیری مناسب در امور مالی است. به طور خاص ، ما جابجایی را با بازده قیمت R (t) جایگزین می کنیم ، زیرا R (t) تغییر قیمت را با واحد زمان متصل می کند ، که معادله Schrödinger را به حالت غیر وابسته به زمان ساده می کند. از این رو ، همیلتون برای ذرات مالی می تواند تدوین شود ،

در جایی که ℏ ، M ویژگی های ثابت و ذاتی بازار مالی ، مانند سرمایه گذاری در بازار در یک بورس را نشان می دهد. با ترکیب همیلتون با معادله کلاسیک شرودینگر ، معادله شرودینگر برای نظریه مالی کوانتومی (QFSE) با (لی ، 2020) ظاهر می شود.

E سطح انرژی ذرات را نشان می دهد ، که به سطح قیمت کوانتومی برای ذرات مالی اشاره دارد. اصطلاح اول ℏ 2 M D 2 D R 2 اصطلاح انرژی جنبشی است. اصطلاح دوم V (r) نشان دهنده اصطلاح انرژی بالقوه ، یعنی (3. 6) ، بازار مالی کوانتومی است.(R) عملکرد موج QFSE است که با عملکرد چگالی احتمال بازده قیمت تاریخی تقریب می یابد.

مرحله 3: با حل QFSE ، جستجوی فضای عمل را انجام دهید

طبق QFT ، اگر انگیزه بیرونی مانند رویدادهای مالی یا انتشار ارقام مالی بحرانی وجود نداشته باشد ، QFP ها در سطح انرژی خود باقی می مانند (یعنی حالت های تعادل) و نوسانات منظم را انجام می دهند. اگر یک محرک خارجی وجود داشته باشد ، QFP ها انرژی کم شده را جذب یا آزاد می کنند و به سایر QPL ها می پرند. بنابراین ، QPL های روزانه را می توان به عنوان حالت های بالقوه حرکات قیمت در یک روز تجارت مشاهده کرد. از این رو ، ما از QPL ها به عنوان کاندیداهای عمل در فضای عمل A = A 1 ، A 2 ،… ، A A از QF-Madeet استفاده می کنیم. روش عددی مفصل برای حل QFSE و الگوریتم برای جستجوی فضای عمل مبتنی بر QPL در پرونده تکمیلی آورده شده است.

3. 2 یادگیری و بازنمایی ویژگی های عمیق توسط شبکه های LSTM

شبکه های LSTM عملکرد امیدوار کننده در یادگیری ویژگی های متوالی را به عنوان سازگاری ساختاری آن نشان می دهند (گرز و همکاران ، 2000). ما شبکه های LSTM را برای استخراج ویژگی های زمانی سری مالی معرفی می کنیم ، بنابراین ادراک در وضعیت بازار شبکه تولید سیاست (PGN) را بهبود می بخشیم.

ما از همان پنجره نگاه به پشت (Wang et al. ، 2019) با اندازه W استفاده می کنیم تا دنباله ورودی x را از سری تکمیل شده S = S 1 ، S 2 ،… ، S T ،… ، S T ، یعنی عامل ، تقسیم کنیم. وضعیت بازار را تا دوره زمانی با اندازه w ارزیابی می کند. از این رو ، ماتریس ورودی LSTM را می توان به عنوان x = x 1 ، x 2 ،… ، x t ،… ، x t - w + 1 ، که در آن x t = s t - w + w |w ∈ [1 ، w] t. ما بردارهای ورودی خود را طراحی می کنیمحرفتوسط: 1) افتتاح ، بالاترین ، کمترین و قیمت بسته برای هر روز تجارت تشکیل شده است. توجه: قیمت نزدیک در T - 1 روز ممکن است با قیمت باز در T به دلیل تعدیل بازار خارج از ساعات معاملات متفاوت باشد. از این رو ، ما کل متغیرهای قیمت را با چهار نوع در نظر می گیریم. 2) حجم معامله. 3) حرکت میانگین همگرایی واگرایی یک شاخص فنی برای شناسایی وضعیت بازار است. 4) شاخص قدرت نسبی یک شاخص فنی است که اندازه گیری قیمت آن است. 5) باند بولینگر (اصلی ، بالا و پایین) می تواند برای شناسایی دامنه قیمت بالقوه ، در نتیجه مشاهده روند بازار استفاده شود (Colby and Meyers ، 1988). 6) KDJ (نوسان ساز تصادفی) در معاملات کوتاه مدت با تکنیک های سرعت قیمت استفاده می شود (Colby and Meyers ، 1988).

تجزیه و تحلیل مؤلفه های اصلی (PCA) (Wold et al. ، 1987) برای فشرده سازی داده های سری S به ابعاد F ̃ و Denoise استفاده می شود (Wold et al. ، 1987). پس از آن ، عادی سازی L2 برای مقیاس ویژگی های ورودی در همان اندازه اعمال می شود. پیش پردازش به صورت محاسبه می شود ،

جایی که ξ پارامترهای قابل آموزش برای LSTM است.

3. 3 شبکه های ژنراتور خط مشی (PGN)

با توجه به بردار ویژگی آموخته Hحرف، PGN با توجه به نمره عمل Z T I که توسط یک شبکه کاملاً متصل (FFBPN) تولید شده است ، به طور مستقیم سیاست خروجی ، یعنی احتمال تسویه ترتیب در هر + QPL و-QPL را تولید می کند.

که در آن θ پارامترهای FFBPN را با ماتریس وزنی w می کندθو تعصب بθبشربگذارید یک عمل من در زمان t نشان دهد. سیاست خروجی aحرفمحاسبه می شود ،

در Timestep t ، مدل اقدام A انجام می دهدحرفبا نمونه گیری از خط مشی A t +-متشکل از جهت معاملات طولانی ( +) و کوتاه (-). T + - حاوی ابعادی است که نشان دهنده تعداد اقدامات نامزد است ، با پاداش بازده قیمت برای هر یک ،

r t i = δ q p l δ i - p t o ، ∀ q p l Δ i ∈ P t h ، p t l δ p t c - p t t ، ∀ q p l δ i ∉ p t h ، p t l (14)

جایی که δ جهت تجارت را نشان می دهد: برای اقدامات با + QPL به عنوان سطح قیمت هدف برای تسویه حساب ، معاملات به عنوان خرید طولانی تعیین می شود (δ = + 1). برای اقدامات د ر-QPL ، معاملات کوتاه (δ = -1) تجارت انجام می شود. و δ 0 است که تصمیم به خنثی شدن است ، زیرا هیچ معاملاتی در روز معاملات T انجام نمی شود.

ما qf-tradeet خود را با یادگیری تقویت کننده آموزش می دهیم. ایده اصلی این است که یک حلقه با مراحل پی در پی حفظ کنید: 1) عامل π آگاه بودن محیط ، 2) π عمل را انجام دهید ، و 3) رفتار خود را تنظیم کنید تا پاداش بیشتری دریافت کند تا اینکه عامل هدف یادگیری خود را دریافت کند (ساتون و بارتو، 2018). بنابراین ، برای هر قسمت آموزشی ، یک مسیر τ = (H 1 ، A 1) ، (H 2 ، A 1) ، ... ، (H T-1 ، A T) می تواند به عنوان توالی Tuple Action (عمل) تعریف شود. توالی بازگشت مربوطه 1 r = r 1 ، r 2 ، r 3 ،… ، r t. احتمال عمل PR (عملحرف= من) برای هر QPL توسط QF-madeet به عنوان:

اجازه دهید rτبازده قیمت تجمعی را برای مسیر τ نشان می دهد ، با ∑ t = 1 t - w + 1 r t (i) = r τ. سپس ، برای همه مسیرهای کاوش شده ممکن ، پاداش انتظار به دست آمده توسط عامل RL می تواند به عنوان ارزیابی شود (Sutton et al. ، 2000) ،

جایی که p r (τ | θ ، ξ) π احتمال عامل qf-sradeet π با پارامترهای θ و ξ برای تولید مسیر τ با شبیه سازی مونت کارلو است. سپس ، هدف این است که حداکثر انتظار پاداش ، θ * ، ξ * = argmax را به حداکثر برساندθ ، ξj (θ ، ξ). ما هدف را با معکوس آن جایگزین می کنیم و از نزول شیب برای بهینه سازی استفاده می کنیم. برای جلوگیری از حداقل پروبوم محلی ناشی از اقدامات چند پس از پاداش ، ما از روش آستانه وابسته به دولت (Sutton and Barto ، 2018) استفاده می کنیم تا به عامل RL اجازه دهد بهینه سازی کارآمد تری داشته باشد. محاسبه شیب دقیق در مکمل آورده شده است.

3. 4 سیاست تجارت با سود نرم و کنترل ضرر قابل یادگیری

در QF-Tradeet ، شبکه های LSTM نمایش پنهان را یاد می گیرند و آن را به PGN تغذیه می کنند. سپس PGN سیاست آموخته شده را برای تصمیم گیری در مورد هدف QPL برای حل و فصل ایجاد می کند. از آنجا که این عمل از خط مشی تولید شده نمونه برداری می شود ، QF-Madeet یک استراتژی کنترل سود و از دست دادن نرم را به جای TP و SL قطعی اتخاذ می کند. خلاصه کلی معماری QF-Madeet در شکل 3 نشان داده شده است.

www.frontiersin.org

شکل 3. چارچوب RL برای QF-tradeet.

یک روش معادل برای تفسیر استراتژی ما این است که اگر تصمیم در QPL مثبت گرفته شود ، مدل ما با خرید طولانی معامله می کند. در معکوس ، معاملات فروش کوتاه انجام می شود. پس از تصمیم گیری جهت تجارت ، QPL هدف با حداکثر احتمال به عنوان قیمت هدف نرم (S-TP) در نظر گرفته می شود و خط ضرر نرم Soft QPL با بالاترین احتمال در جهت معاملات مخالف خواهد بود. یک نمونه در شکل 4 ارائه شده است.

www.frontiersin.org

شکل 4. یک مطالعه موردی استراتژی کنترل سود و از دست دادن ما را نشان می دهد. سیاست تجارت در ابتدا به طور یکنواخت توزیع می شود. در حالت ایده آل ، مدل ما عمل +3 QPL را اختصاص می دهد که حداکثر سود را با بزرگترین احتمال به عنوان S-TP به دست می آورد. از طرف کوتاه ، 1 qpl می تواند بیشترین پاداش را به دست آورد و منجر به اعتبار حداکثر احتمال S-SL می شود.

از آنجا که کنترل S-TP و S-SL مبتنی بر احتمال است ، هنگامی که قیمت به طور زودرس خط ضرر توقف را لمس می کند ، QF-Tradeet مجبور به انجام تسویه حساب نمی شود. این فکر خواهد کرد که آیا قیمت هدف بهتری برای تسویه حساب در کل فضای عمل وجود دارد یا خیر. بنابراین ، این مدل برای کنترل SL و TP در حالت های مختلف انعطاف پذیرتر است ، در مقایسه با استفاده از یک زن و شوهر از هیپرامترهای از پیش تعیین شده "سخت".

4 آزمایش

ما ارزیابی تجربی را برای QF-Madeet خود در انواع مختلف مجموعه داده های مالی انجام می دهیم. در آزمایش ما ، هشت مجموعه داده از 4 دسته استفاده می شود ، از جمله 1) محصول ارزی: پوند بریتانیا در مقابل دلار ایالات متحده (GBPUSD) ، دلار استرالیا در مقابل دلار ایالات متحده (AUDUSD) ، یورو در مقابل دلار ایالات متحده (EURUSD) ، دلار ایالات متحده در مقابل سوئیس فرانک (USDCHF) ؛2) شاخص های مالی: فهرست S& P 500 (S& P500) ، Hang Seng Index (HSI) ؛3) فلز: نقره در مقابل دلار ایالات متحده (XAGUSD) ، و 4) روغن خام: نفت در مقابل دلار ایالات متحده (روغن روغن). ارزیابی از منظر کسب سود انجام می شود. و استحکام هنگامی که مأمورین با تغییر غیر منتظره ایالت های بازار روبرو هستند. ما همچنین تأثیر تنظیمات مختلف جستجوی فضای عمل مبتنی بر QPL پیشنهادی ما برای معامله گر RL و مطالعه فرسایش مدل خود را بررسی می کنیم.

4. 1 تنظیمات آزمایش

کلیه مجموعه داده های مورد استفاده در آزمایشات از مرکز داده های تاریخی رایگان و افتتاح شده در Metatrader 4 ، که یک بستر معاملاتی حرفه ای برای فارکس ، شاخص های مالی و سایر اوراق بهادار است ، گرفته می شود. ما داده های سری زمانی خام ، حدود 2048 روز معاملاتی را بارگیری می کنیم و 90 ٪ جلوی داده ها را برای آموزش و اعتبار سنجی تقسیم می کنیم. بقیه به عنوان تأیید خارج از نمونه مورد استفاده قرار می گیرند ، یعنی سریال مداوم از نوامبر 2012 تا ژوئیه 2019 ، برای ساخت نمونه تمرینی پی در پی تقسیم شده است. قسمت بقیه به عنوان آزمایش و اعتبار سنجی اعمال می شود. با توجه به توجه ، دوره ارزیابی نوسانات اخیر در بازار مالی جهانی ناشی از همه گیر Covid-19 را پوشش داده است ، که می تواند به عنوان آزمایش استحکام هنگام رسیدگی به نوسانات بازار پیش بینی نشده مورد استفاده قرار گیرد. اندازه پنجره نگاه به 3 تنظیم شده است ، و معیارهای مربوط به بازده قیمت و نسبت شارپ روزانه محاسبه می شود. در پشتی ، سرمایه اولیه با هزینه معامله با 0. 3 ٪ به ارز یا دارایی مربوطه با ارزش 10،000 تنظیم می شود (دنگ و همکاران ، 2016). تمام آزمایشات در GPU تک NVIDIA GTX Titan X انجام می شود.

تنظیمات 4. 2 مدل

برای مقایسه مدل خود با روشهای سنتی ، ما مدل معاملات مبتنی بر پیش بینی و سایر نمایندگان تجارت مبتنی بر یادگیری تقویت کننده را به عنوان پایه انتخاب می کنیم.

• پایه بازار (هوانگ و همکاران ، 2016). این استراتژی برای اندازه گیری عملکرد کلی بازار در این دوره T ، با نگه داشتن محصول به طور مداوم استفاده می شود.

• DDR-RNN. به دنبال ایده تقویت مستقیم عمیق ، اما ما تجزیه و تحلیل مؤلفه اصلی (PCA) را برای denoise و تهیه داده ها اعمال می کنیم. ما همچنین از RNN برای یادگیری ویژگی ها استفاده می کنیم ، و یک FFBPN دو لایه به عنوان ژنراتور خط مشی به جای رگرسیون لجستیک در طراحی اصلی. این مدل را می توان به عنوان مطالعه فرسایش QF-tradeet بدون جستجوی فضای عمل QPL در نظر گرفت.

• FCM ، یک مدل پیش بینی مبتنی بر پیش بینی روند RNN ، متشکل از یک LSTM 7 لایه با ابعاد پنهان 512. این تجارت با یک استراتژی برنده خرید و فروش-فروشنده معامله می شود.

• RF. طراحی مشابه با FCM اما روند را از طریق جنگل تصادفی پیش بینی کنید.

• QF-PGN. QF-PGN عامل RL مبتنی بر شیب خط مشی با کنترل سفارش مبتنی بر QPL است. FFBPN منفرد به عنوان ژنراتور خط مشی با 3 لایه RELU و 128 نورون در هر لایه استفاده می شود. این مدل می تواند به عنوان مدل ما بدون بلوک نمایندگی عمیق پذیرفته شود.

• fdn (دنگ و همکاران ، 2016). یک معامله گر تقویت کننده مستقیم RL به دنبال تجارت یک محصول ، با استفاده از نمایندگی فازی و AutoEncoder عمیق برای استخراج ویژگی ها.

ما دو نسخه از qf-madeet را پیاده سازی می کنیم: 1) qf-madeet lite (qftn-l): 2 لایه LSTM با بردار پنهان 128 بعدی به عنوان بازنمایی ویژگی ، و 3 لایه شبکه ژنراتور خط مشی با 128 ، 64 ، 32 نورون در هرهر یک. اندازه فضای عمل 3. 2) qf-tradeet ultra (Qftn-u) است: همان معماری با LITE ، اما تعداد اقدامات نامزد به 7 افزایش یافته است.

با توجه به تنظیمات آموزش ، بهینه ساز تخمین لحظه تطبیقی (ADAM) با 1500 دوره آموزش برای کلیه مدلهای بهینه سازی تکراری با نرخ یادگیری 0. 001 استفاده می شود. برای الگوریتم هایی که به PCA نیاز دارند ، ابعاد هدف F ̃ در 4 تنظیم شده است ، رضایت از ماتریس آهنگسازی 99. 5 ٪ از روابط متقابل ویژگی ها را تعبیه کرده است. در اجرای عملی ، ما مستقیماً از چهار قیمت به عنوان ورودی USDCHF ، S & P500 ، XagusD و Oil Use استفاده می کنیم. مرحله عادی سازی برای HSI و استفاده از روغن انجام نمی شود. دلیل این امر این است که نتایج تجربی ما نشان می دهد که مدل ما می تواند وضعیت بازار را به اندازه کافی خوب در این تنظیمات درک کند. به خاطر پیچیدگی محاسباتی ، ویژگی های ورودی اضافی را حذف می کنیم.

4. 3 عملکرد در 8 مجموعه داده مالی

همانطور که در شکل 5 و جدول 1 نشان داده شده است ، ما ارزیابی سودآوری هر سیستم تجارت را در 8 مجموعه داده ، با معیارهای بازده قیمت تجمعی (CPR) و نسبت شارپ (SR) ارائه می دهیم. CPR با فرموله شده ،

تحليلات الفوركس...
ما را در سایت تحليلات الفوركس دنبال می کنید

برچسب : نویسنده : یکتا ناصر بازدید : <-PostHit-> تاريخ : پنجشنبه 25 اسفند 1401 ساعت: 14:05