استدلال اصلی به نفع استفاده از داده های مصنوعی این است که یکی از مهمترین نگرانی ها در مورد استفاده از سری داده های واقعی برای اهداف مدل سازی را برطرف می کند: یعنی این که مدل هایی که برای متناسب بودن داده های تاریخی طراحی شده اند ، نتایج آزمایشی را تولید می کنند که بعید به نظر می رسد ، پیش می روند. چنین مدلهایی نسبت به تغییراتی که احتمالاً در هر فرآیند آماری دینامیکی رخ می دهد ، قوی نیستند و در نتیجه عملکرد ضعیفی از نمونه دارند.
با استفاده از چندین سری داده های مصنوعی به دنبال طیف گسترده ای از مسیرهای مختلف قیمت ، می توان امیدوار بود که مدل هایی - هم برای اهداف مدیریت ریسک و هم برای سرمایه گذاری - ایجاد کند که می تواند انواع سناریوهای مختلف بازار را در خود جای دهد ، و باعث می شود که آنها بیشتر در یک زنده انجام دهندزمینه بازار.
تولید داده های مصنوعی معتبر یک چالش مهم است ، موردی که سالها محققان را از بین می برد. تولید سری بازده مصنوعی یک کار بسیار ساده تر است ، اما حتی در اینجا مشکلات وجود دارد. برای بسیاری از برنامه ها ، نمونه برداری از توزیع تجربی کافی نیست ، زیرا ما می خواهیم دنباله ای از بازده ها را تولید کنیم که از نزدیک الگوی توالی های بازده واقعی را نشان می دهد. به طور خاص ، ممکن است اثرات حافظه طولانی (همبستگی های غیر صفر در تاخیر طولانی) یا اثرات GARCH وجود داشته باشد ، که در آن وابستگی از طریق مربع (یا مقدار مطلق) بازده به فرآیند بازده وارد می شود. اینها تأثیر ایجاد "شوک" به فرآیند بازده که برای مدتی ادامه دارد ، ایجاد می کند و باعث همبستگی در فرآیند نوسانات مرتبط در این فرآیند می شود.
But producing a set of synthetic stock price data is even more of a challenge because not only do the above do the above requirements apply, but we also need to ensure that the open, high, low and closing prices are inteally consistent, i.e. that on any given bar the High>=. این بررسی های سازگاری اساسی تاکنون در تحقیقات نادیده گرفته شده است.
روشهای اقتصاد سنجی
یک رویکرد کلاسیک برای مشکل ایجاد یک مدل اتورگرایی بردار است که در آن مقادیر تاخیر قیمت های باز ، بالا ، پایین و نزدیک برای پیش بینی مقادیر فعلی استفاده می شود (برای نمایش دقیق رویکرد VAR در اینجا ببینید). یک استدلال قانع کننده به نفع چنین مدلهایی این است که ، تقریباً طبق تعریف ، قیمت O/H/L/C لزوماً یکپارچه شده است.
در حالی که یک مدل VAR به طور بالقوه توانایی مدل سازی حافظه طولانی و حتی اثرات GARCH را دارد ، به معنای تعریف شده در بالا ، قادر به تولید قیمت سهام نیست که تضمین شده باشد. در واقع ، میزان خرابی 35 ٪ یا بالاتر برای بررسی های سازگاری اساسی برای چنین مدلی معمولی است و باعث می شود سودمندی سری قیمت های مصنوعی بسیار سوال برانگیز باشد.
رویکرد دیگری که مورد علاقه برخی از محققان قرار گرفته است این است که نمونه های زیر مجموعه های داده های واقعی را در یک مرتبه زمانی متفاوت جمع کنید. این فقط برای بازگشت سری ها قابل اجرا است و در هر صورت می تواند همبستگی های فریبنده را معرفی کند یا از وابستگی های مهم در سری داده ها غافل شود. علاوه بر این نقص ها ، تولید یک سری مصنوعی که به نظر می رسد متفاوت از اصل است - چالش برانگیز است - هر دو سری واقعی و مصنوعی قله ها و فرورفتگی های مشترکی را نشان می دهند ، حتی اگر در مکان های مختلف در هر سری اتفاق بیفتد.
شبکه های مخالف مولد عمیق یادگیری
در یک پست قبلی ، من با جزئیات در Timgan ، یکی از روش های جدید برای تولید سری داده های مصنوعی که در مقاله ای در سال 2019 توسط یون ، و همکاران (پیوند اینجا) معرفی شده بود ، نگاه کردم.
Timgan ، که از شبکه های دشمنی مولد عمیق برای ایجاد سری داده های مصنوعی استفاده می کند ، به نظر می رسد برای انواع خاصی از سری های زمانی بسیار خوب کار می کند. اما در تحقیقات من به سه دلیل به منظور تولید داده های سهام مصنوعی ناکافی است:
(i) این مدل داده های مصنوعی از طول پنجره های ثابت را تولید می کند و این را با هم بخیه می کند تا یک سری واحد ایجاد شود می تواند مشکل ساز باشد.
(ب) قیمت ها بدون در نظر گرفتن تعداد دوره های مورد استفاده برای آموزش مدل ، درصد قابل توجهی از تست های سازگاری اساسی را شکست می دهند
.
یکی دیگر از مدل های GAN ، Doppleganger ، معرفی شده توسط Lin ، ET. همدر سال 2020 (مقاله در اینجا) به دنبال بهبود در Timgan است و ادعا می کند "حداکثر 43 ٪ وفاداری بهتر از مدل های پایه" ، از جمله Timegan. با این حال ، در تحقیقات من دریافتم که ، در حالی که Doppleganger خیلی سریعتر از Timgan تمرین می کند ، حتی پس از آموزش برای 500000 دوره ، میزان شکست تست قوام را بیش از 30 ٪ تولید می کند.
محققان برای هر دو Timgan و Doppleganger تمایل به استفاده از معیارهای علوم داده کلاسیک مانند توطئه های TSNE دارند و نه بررسی های سازگاری بیشتر که یک متخصص داده های بازار به آن علاقه مند است ، در حالی که نیازهای پیشرفته تر مانند حافظه طولانی و گارچ است. اثرات بدون ذکر منتقل می شود.
نتیجه گیری این است که روشهای فعلی در تهیه وسیله ای مناسب برای تولید سری قیمت های مصنوعی برای دارایی های مالی که سازگار و به اندازه کافی نماینده هستند ، ناکام هستند تا عملاً مفید باشند.
الگوریتم ایده آل برای تولید سری داده های مصنوعی
در الگوریتم ایده آل برای تولید قیمت سهام به دنبال چه هستیم؟این لیست شامل موارد زیر خواهد بود:
(i) سادگی و کارایی محاسباتی. اگر به دنبال تولید انبوه سری های مصنوعی برای تعداد زیادی دارایی، برای کاربردهای مختلف هستیم، مهم است. برخی از روش های یادگیری عمیق حتی با فرض اینکه یادگیری انتقالی امکان پذیر باشد، برای برآورده کردن این نیاز مشکل دارند.
(ii) The ability to produce price series that are inteally consistent (i.e High>کم، و غیره) در هر مورد.
(iii) باید بتواند طیف وسیعی از سری های مصنوعی را تولید کند که مطابقت آنها با سری قیمت اصلی بسیار متفاوت است. در برخی موارد، ما سری های قیمت مصنوعی را می خواهیم که با قیمت اصلی بسیار مرتبط هستند. در موارد دیگر ممکن است بخواهیم سبد سرمایه گذاری یا سیستم های کنترل ریسک خود را تحت شرایط شدیدی که قبلاً در بازار دیده نشده بود آزمایش کنیم.
(IV) توزیع بازده در مجموعه های مصنوعی باید دقیقاً با سریال های تاریخی مطابقت داشته باشد، زیرا غیر گاوسی و با «دم چاق» است.
(v) توانایی ترکیب جلوه های حافظه طولانی در توالی بازگشت ها.
(vi) توانایی مدل سازی اثرات GARCH در فرآیند بازگشت.
پس از تحقیق در مورد مسئله در طول سال ها، سرانجام موفق شدم الگوریتمی را توسعه دهم که این الزامات را برآورده کند. قبل از پرداختن به مکانیک، اجازه دهید با توضیح کاربرد آن شروع کنم.
کاربرد الگوریتم ایده آل
در این نمایش من از قیمت های روزانه O/H/L/C برای شاخص S& P 500 برای دوره ژانویه 1999 تا ژوئیه 2022 استفاده می کنم که شامل چهار سری قیمت در 5297 دوره روزانه است.

سری قیمت مصنوعی
تولید ده سری مصنوعی با استفاده از الگوریتم حدود 2 ثانیه با موازی سازی طول می کشد. من انتخاب کردم که سریال هایی با طول مشابه نسخه اصلی تولید کنم، اگرچه می توانستم به همین راحتی سکانس های کوتاه تر یا طولانی تر تولید کنم.
اولین کار تأیید این است که داده های مصنوعی از نظر داخلی سازگار هستند و در واقع به دلیل نحوه طراحی الگوریتم، تضمین شده است که چنین باشد. به عنوان مثال، اولین بارهای روزانه از اولین سری مصنوعی در اینجا آمده است:

البته این بدان معناست که می توانیم بلافاصله سری مصنوعی را در نمودار شمعی ترسیم کنیم، درست همانطور که با سری داده های واقعی در بالا انجام دادیم.

در حالی که سری واقعی و مصنوعی کاملاً متفاوت است ، الگوی قله ها و فرورفتگی ها به نوعی قابل تشخیص به نظر می رسد. بنابراین ، این نیز رو به بالا در این سریال است ، که در این مورد ، شاخص مصنوعی S& P 500 را به بالای 10،000 در سال 2022 منتقل می کند. بدیهی است که این یک سناریوی بسیار صعودی تر است که ما در واقعیت دیده ایم. اما در واقع این فقط یک نمونه است که از انتهای "خوش بینانه" طیف امکانات گرفته شده است. تصویری از انتهای مخالف طیف در نمودار زیر نشان داده شده است ، که در آن شاخص در کل طول 23 ساله به صورت یک طرفه حرکت می کند ، با چندین کاهش بسیار بزرگ ا ز-20 ٪ یا بیشتر:

یک سناریوی معمولی ممکن است چیزی شبیه به نمودار سوم ما باشد ، در زیر. در اینجا ، ما نیز چندین کاهش بسیار بزرگ را مشاهده می کنیم ، به خصوص در دوره 2010 تا 2011 ، اما یک روند صعودی عمومی در این فرآیند نیز وجود دارد که این شاخص را قادر می سازد تا به سطوح قابل مقایسه با مواردی که توسط سری واقعی حاصل می شود ، برسد:

همبستگی قیمت
با منعکس کننده این تحولات مسیر قیمت بسیار متفاوت ، ما تغییرات زیادی در همبستگی بین سری قیمت های واقعی و مصنوعی مشاهده می کنیم. مثلا:

همانطور که این جداول نشان می دهد ، این الگوریتم قادر به تولید سری ماکت است که یا سری اصلی و قیمت واقعی را بسیار نزدیک تقلید می کند ، یا مانند مثال دوم رفتار کاملاً متفاوتی را نشان می دهد.
کاهش ابعاد
برای کامل بودن ، مانند محققان قبلی ، ما کاهش ابعاد T-SNE را اعمال می کنیم و وزن دو عاملی را برای داده های واقعی (زرد) و مصنوعی (آبی) ترسیم می کنیم. ما مشاهده می کنیم که در حالی که در فضای کاهش یافته همپوشانی قابل توجهی وجود دارد ، به عنوان مثال برای داده های مصنوعی تولید شده توسط Timgan ، به همان اندازه تلفظ نمی شود. با این حال ، همانطور که قبلاً توضیح داده شد ، ما نسبت به آزمایشاتی که قبلاً توضیح داده شد ، از این موضوع کمتر نگران هستیم ، که از نظر ما معیار تجزیه و تحلیل مناسب تری را ارائه می دهد ، تا آنجا که به داده های بازار مربوط می شود. علاوه بر این ، به دلایلی که قبلاً آورده شده است ، ما می خواهیم داده های بازار مصنوعی داشته باشیم که در برخی موارد ، فراتر از محدوده ای که در سری قیمت های تاریخی دیده می شود ، دنبال می شود.

توزیع ها را برمی گرداند
در ادامه ، ما در مقایسه با سری داده های واقعی ، ویژگی های بازده در سری مصنوعی را در نظر می گیریم ، جایی که بازده ها به عنوان تفاوت در قیمت های ورود به سیستم ، به روش معمول اندازه گیری می شوند.
هیستوگرام بازده برای سناریوهای "خوش بینانه" و "بدبین" که قبلاً ترسیم شده است در زیر نشان داده شده است:

در هر دو مورد ، توزیع بازده در سری مصنوعی از نزدیک با فرآیند بازده واقعی مطابقت دارد و به وضوح غیر گیزسی است و دارای وزن بیش از حد در دم توزیع است. نگاهی دقیق تر به ویژگی های توزیع برای چهار سری مصنوعی اول نشان می دهد که در هر مورد یک مسابقه بسیار خوب با روند بازده واقعی وجود دارد (نتایج سری های دیگر بسیار مشابه هستند):

ما مشاهده می کنیم که حداقل و حداکثر بازده سری مصنوعی گاهی اوقات از سریال های واقعی فراتر می رود ، که می تواند یک ویژگی مفید برای برنامه های مدیریت ریسک باشد. میانه و میانگین سری واقعی و مصنوعی در موارد دیگر پایین تر ، گاهی اوقات بالاتر است. فقط برای انحراف استاندارد بازده ، ما یک الگوی سیستماتیک را مشاهده می کنیم ، که در آن بازده نوسانات در سری مصنوعی به طور مداوم بالاتر از سری واقعی است.
من استدلال می کنم که این ویژگی هم مناسب و هم مفید است. انحرافات استاندارد به طور کلی باید بالاتر باشد ، زیرا در واقع عدم اطمینان بیشتر در مورد قیمت ها و بازده در داده های مصنوعی تولید شده مصنوعی ، در مقایسه با سری واقعی وجود دارد. علاوه بر این ، این ویژگی مفید است ، زیرا این امر بار استرس بیشتری را بر روی سیستم های مدیریت ریسک در مقایسه با صرفاً از توزیع بازده واقعی با استفاده از شبیه سازی مونت کارلو تحمیل می کند. به عبارت ساده ، تعداد بیشتری از رویدادهای دم شدیدتر در سناریوها با استفاده از داده های مصنوعی وجود خواهد داشت ، و این باعث می شود پارامترهای کنترل ریسک محافظه کارانه تر از آنچه در غیر این صورت ممکن است تنظیم شود. همین ویژگی - تغییر بیشتر در قیمت ها و بازده ها - همچنین برای سیستم های هوش مصنوعی که سعی در ایجاد استراتژی های تجاری با استفاده از برنامه نویسی ژنتیکی دارند ، چالش سخت تری خواهد داشت ، به این معنی که هرگونه استراتژی به احتمال زیاد در یک محیط تجارت زنده انجام می دهد. من در یک پست پیگیری به این موضوع باز خواهم گشت.
ویژگی های فرآیند را برمی گرداند
در طرح زیر نگاهی به همبستگی های موجود در فرآیند بازده برای یک سری مصنوعی معمولی می اندازیم. اینها از نزدیک با همبستگی های موجود در سری بازده های واقعی تا 50 تاخیر مقایسه می شوند ، به این معنی که احتمالاً هرگونه اثر حافظه طولانی حفظ می شود.

سرانجام ، هنگامی که ما همبستگی های موجود در مربع بازده را در نظر می گیریم ، ضرایب پوسیدگی را به آرامی در طول تاخیر طولانی مشاهده می کنیم-شواهدی از به اصطلاح جلوه های گارچ-برای هر دو سری واقعی و مصنوعی:

خلاصه
به طور کلی ، ما مشاهده می کنیم که این الگوریتم قادر به تولید سری قیمت سهام ثابت است که با سری قیمت واقعی ارتباط زیادی دارد. همچنین قادر به تولید سری قیمت هایی است که همبستگی کم یا حتی منفی دارند ، ویژگی ای که ممکن است در زمینه مدیریت ریسک برنامه های مهمی داشته باشد. توزیع بازده در سری مصنوعی از نزدیک با فرآیند بازده واقعی مطابقت دارد و علاوه بر این ویژگی های مهمی مانند حافظه طولانی و جلوه های گارچ را حفظ می کند.
اعتراض به استفاده از داده های مصنوعی
انتقاد از داده های بازار مصنوعی (از جمله از خودم) تاکنون بر عدم کفایت چنین داده هایی از نظر نشان دهنده ویژگی های مهم سری داده های واقعی متمرکز شده است. اکنون که به چنین مسائل فنی پرداخته شده است ، سعی خواهم کرد برخی از نگرانی های اضافی را که احتمالاً در سطح آن قرار دارند پیش بینی کنم.
- داده های مصنوعی "غیرواقعی" است
منظورش این است که هیچ مجموعه ای قابل قبول از عوامل واقعی و اقتصادی وجود ندارد که احتمالاً به شکلی برای تولید الگوی قیمت های نشان داده شده در برخی از سری داده های مصنوعی ترکیب شود. این ایده که ، همانطور که در یکی از سناریوهای مصنوعی فوق مشاهده شد ، فدرال رزرو در حالی که بازار 50 ٪ تا 60 ٪ کاهش می یابد ، بیکار خواهد بود. به همان اندازه بعید به نظر می رسد سناریویی که در آن بازار برای مدت طولانی یک دهه یا طولانی تر به پهلو حرکت می کند.
تا حدی محدود ، من با این موضوع موافقم. با این حال ، فقط به این دلیل که چنین سناریوهایی بعید به نظر می رسد که هرگز نمی توانند اتفاق بیفتند. به عنوان مثال ، به عملکرد شاخص S& P 500 در طول دوره 1966 تا 1979 نگاهی بیندازید:

شاخص بازار به سختی پیشرفتی را در کل دوره 13 ساله انجام داد ، که با یک دوره شرور از رکود مشخص شد. توجه داشته باشید ، افت شدید این شاخص به دنبال شوک نفتی در سال 1973.
بنابراین این که بگوییم چنین سناریوهایی - هرچند ممکن است غیرممکن به نظر برسد - هرگز نمی تواند اتفاق بیفتد به سادگی اشتباه می شود.
سرانجام ، فراموش نکنیم که ، در حالی که تمرکز این مقاله بر روی شاخص بازار ایالات متحده است ، اقتصادهای زیادی مانند مکزیک ، برزیل یا آرژانتین وجود دارد که چنین تحولات جانبی بسیار معتبرتر از آنچه در حال حاضر ممکن است برای یونایتد باشدایالت ها. ما ممکن است بخواهیم برای اهداف مدل سازی داده های مصنوعی را برای بازارها در چنین اقتصادهایی تولید کنیم ، در این صورت می خواهیم داده های مصنوعی را تولید کنیم که طیف کاملی از نتایج ممکن را در بازار از جمله برخی از بدترین سناریوها را ضبط کنیم.
2. سناریوهای شدید بیش از حد در داده های مصنوعی رخ می دهد
در واقع اینگونه نیست - ژنراتور با توجه به تاریخ و ویژگی های فرآیند قیمت واقعی و واقعی ، سناریوهای شدید را با فرکانس قابل قبول تولید می کند. اما دلایل خوبی برای تمایل به کنترل فرکانس چنین سناریوها وجود دارد.
به عنوان مثال ، یک مدیر سرمایه گذاری ممکن است به دنبال توسعه یک سبد سرمایه گذاری "فقط" باشد زیرا با توجه به درخواست سرمایه گذاری وی ، این تنها نوع استراتژی سرمایه گذاری مجاز است. او احتمالاً می خواهد به دو دلیل تمرکز خود را به نتایج خوش خیم تر بازار محدود کند: (من) پایان نامه سرمایه گذاری وی این است که بازار احتمالاً عملکرد خوبی دارد ، پیش می رود (وگرنه چگونه او استراتژی خود را برای سرمایه گذاران پیش می برد؟) و(ii) در حالی که او می پذیرد که ممکن است اشتباه کند ، وظیفه او نیست که از رکود احتمالی بازار محافظت کند - مسئولیت برخورد با نتیجه منفی بر عهده مدیر ریسک وی یا سرمایه گذار است.
در مقابل ، یک مدیر ریسک بسیار بیشتر به سناریوهای نامطلوب علاقه دارد و در صورت وجود هر چیزی ، احتمالاً می خواهد چنین نتایج را در نمونه ای از داده های مصنوعی مشاهده کند.
نکته این است که هیچ پاسخ صحیح وجود ندارد: باید تصمیم گرفت که کدام نوع سناریو به بهترین وجهی متناسب با برنامه ای است که در ذهن دارد و داده ها را بر این اساس نمونه می کند. این کار می تواند به روش های مختلفی از قبیل تنظیم حداقل همبستگی مورد نیاز بین سری قیمت های مصنوعی و واقعی یا طراحی سیستم نمونه برداری طبقه بندی شده انجام شود که در آن نتایج مورد نظر با توجه به توزیع فرکانس پیش بینی شده نمونه برداری می شود.
3. داده های مصنوعی مانع از چرت زدن داده ها و اتصالات منحنی نمی شود
یک منتقد ممکن است استدلال کند که ، در حقیقت ، داده های واقعی بازار فقط به معنای نظری "غیب" است ، زیرا ویژگی های اساسی آن در سری مصنوعی تولید شده توسط ژنراتور پخته شده است. اگر سری مصنوعی به نوعی نمونه برداری شود ، همانطور که در بالا توضیح داده شد ، این امر حتی بیشتر نیز صدق می کند.
من فکر می کنم این یک نکته عادلانه است. برای استفاده از یک سناریوی شدید ، می توان فقط سری مصنوعی را انتخاب کرد که همبستگی با داده های واقعی 99. 9 ٪ یا بالاتر باشد. بدیهی است که این خلاف روحیه ای است که فرد با داده های مصنوعی به آن دست می یابد و ممکن است از داده های واقعی برای اهداف مدل سازی استفاده کند. در عمل ، البته ، حتی در مواردی که یک روش نمونه برداری اعمال می شود ، بعید به نظر می رسد مانند این مثال به شدت مغرضانه باشد.
اما ، در هر صورت ، جایگزین چیست؟تنها گزینه ای که می توانم ببینم ، راه دیگری است که در آن از یک مدل ریاضی خالص برای تولید داده های مصنوعی استفاده می شود ، بدون هیچ گونه اشاره ای به سری واقعی زیرین. اما ، در این حالت ، چگونه می توان اعتبار فرضیات مدل را ارزیابی کرد ، یا اینکه ممکن است سری مصنوعی تولید شود؟
هیچ جایگزینی جز مراجعه به داده های واقعی در مقطعی از فرآیند مدل سازی وجود ندارد. در این روش ، با این حال ، تأثیر تعصب یا متناسب با منحنی ، حتی اگر هرگز نمی توان کاملاً خاموش نشد ، بسیار کاهش یافته است و نقش کمتری در توسعه مدل دارد.
نتیجه
اکنون می توان سری داده های مصنوعی تولید کرد که دارای تمام ویژگی های مشخصه داده های قیمت واقعی است. این به تحلیلگر اجازه می دهد تا مدل های بازار را بدون مراجعه مستقیم به سری قیمت های واقعی بررسی کند ، در نتیجه به حداقل رساندن داده ها و تعصب متناسب با منحنی. مدل های توسعه یافته با استفاده از داده های مصنوعی که توصیف بسیاری از تحولات مسیر قیمت مختلف است ، بیشتر به احتمال زیاد در طیف گسترده تری از سناریوهای بازار قابل قبول در دنیای واقعی اثبات می کنند.
در مرحله بعد ، پست پیگیری من استفاده از داده های مصنوعی را برای توسعه یک استراتژی سرمایه گذاری قوی نشان می دهم.
حساب اسلامي...
ما را در سایت حساب اسلامي دنبال می کنید
برچسب :
نویسنده : کامران فیوضات
بازدید : <-PostHit->
تاريخ : چهارشنبه
3 خرداد
1402 ساعت: 12:10