۱٫ مقدمه
شبکه های اجتماعی مبتنی بر مکان مانند Weibo و Twitter نقش مهمی در زندگی افراد دارند. آنها به افراد اجازه می دهند تا دوستان خود را پیگیری کنند و تعامل بین آنها را افزایش دهند. محبوبیت این نرم افزار منجر به تولید رکوردهای بسیاری از POI شده است که نشان می دهد افراد چه زمانی و کجا از مکان های خاصی بازدید کرده اند. این داده های POI برای مطالعات تحرک انسانی [ ۱ ]، شناسایی ناحیه عملکردی شهری [ ۲ ] و برنامه ریزی شهری [ ۳ ] اهمیت زیادی دارند. همراه با دادههای سرشماری، مسیرهای ورود این کاربران در ارتباط با POI نیز میتواند برای تخمین اندازه اشتغال تفکیک شده استفاده شود [ ۴ ]]. علاوه بر این، بر اساس اطلاعات ردیابی تاریخی، این نرم افزار همچنین می تواند POI احتمالی بعدی را برای بازدید کاربران توصیه کند و آنها را ترغیب کند تا شهر خود را بهتر درک کنند و تجربه کاربری را بهبود بخشند.
بیشتر روشهای پیشنهادی اولیه POI از تکنیکهای فیلتر مشترک و تکنیکهای فاکتورسازی ماتریسی استفاده میکردند. تکنیک فیلتر مشترک [ ۵ ] برای کشف علایق کاربران از داده های رفتار تاریخی آنها و توصیه POIهایی که ممکن است علاقه مشابهی به کاربران داشته باشند، استفاده می شود. به طور همزمان، توصیه POI بر اساس فاکتورسازی ماتریس [ ۶تکنیک ] یک ماتریس رتبه بندی را بر اساس اطلاعات ثبت نام موجود کاربر ایجاد می کند و یک POI را با توجه به رتبه بندی خود توصیه می کند. با این حال، مسیر رفتاری افراد اغلب به زمینه مکانی-زمانی و نظم POI مرتبط است. برای مثال، زمانی که در تمام روز کار میکنید، مردم بیشتر به جای یک باشگاه ورزشی در فاصله صد مایلی، یک رستوران نزدیک را برای شام انتخاب میکنند. در این مورد، توصیههای POI بعدی زمانی مفیدتر هستند که اطلاعات زمینه مکانی-زمانی و رابطه توالی مسیر را در نظر بگیرند.
در سالهای اخیر، بیشتر کار بر روی توصیههای POI بعدی، از یادگیری عمیق برای ثبت ترجیحات کاربر استفاده کرده است. شبکههایی مانند DNN (شبکههای عصبی عمیق) [ ۷ ]، RNN (شبکههای عصبی مکرر) [ ۸ ]، LSTM (حافظه کوتاهمدت بلندمدت) [ ۹ ] و توجه به خود [ ۱۰ ]، بهطور گسترده مورد استفاده قرار گرفتهاند. به عنوان مثال، لیان و همکاران. [ ۱۱ ] یک روش توصیه مکان را بر اساس یک شبکه خودتوجهی برای توصیههای توالی آگاه از زمین پیشنهاد کرد. ژنگ و همکاران [ ۱۲] یک شبکه توجه سلسله مراتبی تقویت شده با حافظه را ارائه کرد که هم توالی ورود کوتاه مدت و هم حافظه بلند مدت را در نظر می گیرد. اگرچه این روشهای مبتنی بر یادگیری عمیق به خوبی توسعه یافتهاند، برخی از مسائل هنوز در رابطه با توصیههای POI بعدی باقی میمانند. به ویژه، این روشها عمدتاً به یادگیری عمیق متوسل میشوند تا با یادگیری روابط غیرخطی بین POI و تنظیمات کاربر، ترجیحات کاربر را به دست آورند، و توجه کمی به استخراج و استفاده از اطلاعاتی که به صراحت ترجیحات کاربر را منعکس میکند، دارند. هنگامی که داده های کمی برای آموزش یا نویز موجود در داده ها وجود دارد، ممکن است به عملکرد خوبی منجر نشود.
برای بهبود توصیههای POI بعدی، این مقاله با در نظر گرفتن اطلاعاتی که ترجیحات کاربر را منعکس میکند، روش توصیه مبتنی بر شبکه توجه را بهبود میبخشد. اولاً، با توجه به اینکه اغلب در کار و زندگی افراد تناوب وجود دارد، در توالی POI های مختلف نیز تناوب وجود دارد. استفاده از اطلاعاتی که دورهای توصیههای POI بعدی را منعکس میکند به بهبود عملکرد توصیه کمک میکند. با در نظر گرفتن ویژگی ماه ورود به عنوان محدودیت، آزمایشهای ما نشان داد که نرخ فراخوان را ۱۱٫۳۷ درصد بهبود میبخشد. دوم، افراد مختلف در عمل ترجیحاتی برای POI های مختلف دارند. بنابراین، دستههای POI نیز میتوانند ترجیحات کاربر را تا حدی منعکس کنند. ما همچنین از ویژگی دسته بندی های POI برای توصیه های بعدی POI استفاده کردیم، و آزمایش ها سهم آن را نشان دادند. علاوه بر این، فاصله عامل مهمی است که بر تصمیم گیری افراد در مورد بازدید یا عدم بازدید از یک POI تأثیر می گذارد. با توجه به این موضوع، ما از یک فیلتر برای حذف POIهای نامزدی استفاده کردیم که در هنگام توصیه POIهای بعدی بیش از فاصله معینی با هم فاصله داشتند. آزمایشها نشان داد که این امر دقت توصیهها را نیز بهبود میبخشد.
بقیه مقاله به شرح زیر سازماندهی شده است. وضعیت فعلی تحقیق در مورد توصیه های POI در بخش ۲ توضیح داده شده است . مشکلات مربوط به توصیه POI بعدی در بخش ۳ به تفصیل آمده است . جزئیات رویکرد پیشنهادی ما در بخش ۴ ارائه شده است . سپس، آزمایش ها و نتایج در بخش ۵ توضیح داده شده و ارائه می شود . در نهایت، نتیجه گیری ما و احتمالات آینده در بخش ۶ بررسی می شود .
۲٫ کارهای مرتبط
۲٫۱٫ کار تحقیقاتی سنتی در مورد توصیه POI
به طور سنتی، فیلترهای مشارکتی و تکنیکهای فاکتورسازی ماتریس برای توصیههای POI استفاده میشوند. به عنوان مثال، آثار Zeng و همکاران. [ ۱۳ ] و وانگ و همکاران. [ ۱۴ ] از الگوریتم های فیلتر مشترک برای بهره برداری از شباهت مسیرهای کاربر استفاده کرد. تورینیو و همکاران [ ۱۵ ] یک الگوریتم توصیه فیلتر مشارکتی مبتنی بر منطقه فازی را پیشنهاد کرد که فقط از دادههای ورود به سیستم استفاده میکرد. به این ترتیب، فعالیتها و ترجیحات کاربران را میتوان از جنبههایی مانند مناطق مورد علاقه و شیوع POI مدلسازی کرد. علاوه بر این، لی و همکاران. [ ۱۶ ] یک الگوریتم فیلتر مشترک مبتنی بر یادگیری ترجیحی حالت نقطه در مجموعه های کاربر-اقلام پیشنهاد کرد.
با این حال، تکنیک های فیلتر مشترک نمی توانند به طور موثر از اطلاعات زمینه ای مانند فضا-زمان کاربر استفاده کنند. رن و همکاران [ ۱۷ ] و دوطلب و همکاران. [ ۱۸ ] هر دو روش فاکتورسازی ماتریس احتمال را با استفاده از اطلاعات متنی، اطلاعات مکانی-زمانی، اطلاعات شبکه های اجتماعی و اطلاعات طبقه بندی پیشنهاد کردند. هو و همکاران [ ۱۹ ] یک روش خوشه بندی مشترک POI بر اساس تجزیه ماتریس غیر منفی با استفاده از اطلاعات مکانی-زمانی و شباهت کاربر پیشنهاد کرد. سیلوا و همکاران [ ۲۰] یک مدل توصیه مشترک بیزی ارائه کرد که محتوای متن مورد، شبکه های اجتماعی کاربر و تعامل کاربر-مورد را یکپارچه می کند. این یک مدل تجزیه پواسون موجود را با افزودن محتوا و ویژگیهای اجتماعی تعمیم داد. با این حال، به طور کلی، ماتریس امتیاز دهی بسیار پراکنده بود، که دقت توصیه ها را محدود می کرد. علاوه بر این، مدل نمی تواند تبدیل توالی آیتم ها را بیاموزد، یعنی اثر ترتیب را در نظر نمی گیرد. توصیه های دقیق POI ارتباط نزدیکی با زمینه مکانی-زمانی و توالی مسیر دارد. بنابراین، لازم است که اطلاعات زمینهای مکانی-زمانی و اطلاعات تبدیل توالی مربوط به موارد در عوامل مرجع برای توصیهها گنجانده شود.
۲٫۲٫ تحقیقات مبتنی بر یادگیری عمیق در مورد توصیه بعدی POI
توصیه POI بعدی در واقع یک توصیه توالی است که انتقال بین POI ها را بر اساس مسیر تاریخی کاربر در نظر می گیرد. الگوریتم های زیادی در سال های اخیر ظهور کرده اند. ژانگ و همکاران [ ۲۱ ] یک رویکرد جدید برای توصیه توالی بر اساس RNN و CNN (شبکه عصبی کانولوشنال) طراحی کرد. هیداسی و همکاران [ ۲۲ ] از یک شبکه عصبی تکراری برای گرفتن اطلاعات معنایی طولانی برای توصیه توالی استفاده کرد. چن و همکاران [ ۲۳ ] یک شبکه عصبی گراف دروازهدار مرتبه ترکیبی (GNN) برای اعمال کافی GNN برای توصیههای مبتنی بر کنترل، بر اساس مشکل هموارسازی بیش از حد، پیشنهاد کرد. گائو و همکاران [ ۲۴] یک مدل توصیه جلسه مبتنی بر شبکههای عصبی گراف دروازهدار و آگاه از متن را پیشنهاد کرد که اطلاعات متنی مرتبط را در تأثیرات توصیهها ترکیب میکند. میتران و همکاران [ ۲۵ ] از یک ترانسفورماتور با یک GNN هدفمند برای استخراج ویژگی استفاده کرد و از توجه چند سر برای گرفتن زمینه های محلی و جهانی استفاده کرد. توانست بازنمایی های غنی تری را برای توصیه های مبتنی بر توالی بیاموزد.
بر اساس توصیه های متوالی، کار تحقیقاتی اخیر در مورد توصیه بعدی POI عمدتاً از الگوریتم های یادگیری عمیق استفاده می کند. لو و همکاران [ ۲۶ ] از مکانیزم توجه برای یادگیری ترجیحات کاربر برای توصیه POI بعدی استفاده کرد. سان و همکاران [ ۲۷ ] مدلسازی ترجیحی بلندمدت و کوتاهمدت، از جمله یک شبکه غیرمحلی برای مدلسازی اولویتهای بلندمدت و یک RNN جغرافیایی توسعهیافته برای یادگیری ترجیحی کوتاهمدت برای توصیههای POI بعدی را پیشنهاد کرد. لیو و همکاران [ ۲۸ ] یک مدل کاوی ترجیحی بلادرنگ مبتنی بر LSTM برای توصیه POI بعدی با محدودیتهای زمانی پیشنهاد کرد. چن و همکاران [ ۲۹] یک روش توصیه POI بعدی مبتنی بر RNN ارائه کرد که هم علایق مکان کاربران مشابه و هم اطلاعات متنی (مانند زمان، مکان فعلی و ترجیحات دوستان) را در نظر می گرفت. وانگ و همکاران [ ۳۰ ] روش DSPR را پیشنهاد کرد، که از انواع مختلف اطلاعات زمینهای مانند زمان مطلق، زمان/فاصله انتقال POI-POI و انواع POI برای مدلسازی تقاضای بلادرنگ و ترکیب ترجیحات کاربر برای توصیههای POI بعدی استفاده میکرد. خو و همکاران [ ۳۱ ] روابط اعتماد جامع کاربر، ترجیحات کاربر، زمان ورود و موقعیت جغرافیایی را در یک مدل فاکتورسازی ماتریسی برای توصیه POI بعدی یکپارچه کرد. آگراوال و همکاران [ ۳۲] یک چارچوب توصیه مکان مبتنی بر جاسازی را پیشنهاد کرد که POI را بر اساس جاسازی برچسب و کاربران (نمایههای کاربر) را بر اساس POIها مدلسازی کرد.
با در نظر گرفتن صریح اطلاعاتی که ترجیحات کاربر را منعکس میکند، متفاوت از روشهای موجود، روش توصیه POI بعدی مبتنی بر شبکههای خود-توجه را بهبود بخشیم. ما پیشنهاد میکنیم ویژگیهایی را در نظر بگیریم که ترجیحات کاربر و عادتهای رفتاری مانند ماه ورود و دستهبندی POI را در نظر بگیریم. علاوه بر این، ما تأثیر فاکتور فاصله را نیز در نظر گرفتیم و هنگام توصیه POI بعدی، POIهای نامزدی را که بیش از فاصله معینی دور بودند حذف کردیم.
۳٫ تعریف مسئله
در این مقاله مجموعه ای از کاربران با نشان داده شده است U= {تو۱،تو۲، ⋯ ،تو| U|}�={تو۱،تو۲،⋯،تو|�|}، جایی که | U||�|تعداد کاربران است. مجموعه ای از POI با نشان داده می شود L = {ل۱،ل۲، ⋯ ،ل| L |}�={ل۱،ل۲،⋯،ل|�|}، جایی که | L ||�|تعداد POI است. هر POI حاوی اطلاعات: ID، طول جغرافیایی و عرض جغرافیایی است که به صورت زیر مشخص می شود: لک= < منDک، l onک، l aتیک>لک=<من�ک،ل��ک،لآتیک>. بر اساس نمایش های فوق، تمام نقاط ورود هر کاربر در یک بازه زمانی را می توان به ترتیب زمانی به یک مسیر تبدیل کرد. سپس، مسیر کاربر n را می توان به صورت نمایش داداسn= {پ۱،پ۲، ⋯ ،پ|اسn|}اس�={پ۱،پ۲،⋯،پ|اس�|}، جایی که پمن= <تومن،لک،تیک،مترک،جک>پمن=<تومن،لک،تیک،مترک،جک>آن کاربر را نشان می دهد تومنتومندر لک�کPOI در زمان تیک�ک. دسته POI است جک�ک، و ماهی که در آن اعلام حضور رخ داده است مترکمترک.
برای تسهیل در محاسبه، طول مسیرهای کاربر به صورت N یکسان شد . علاوه بر این، اگر |اسn| > ن|اس�|>ن، نزدیکترین N نقطه ورود انتخاب می شود و اگر |اسn| < N|اس�|<ن، از سمت راست به مسیر صفر اضافه می شود. با توجه به اطلاعات فوق، مشکل توصیه POI بعدی، توصیه POI بعدی است l ∈ Lل∈�به کاربر با توجه به مسیر آن اسn= {پ۱،پ۲، ⋯ ،پن}اس�={پ۱،پ۲،⋯،پن}و اطلاعات تمام POI ها در L .
۴٫ روش شناسی
این مقاله روش توصیه POI بعدی مبتنی بر شبکه خود-توجه را با استفاده از ویژگی هایی که به صراحت اولویت کاربر را منعکس می کند، بهبود می بخشد. همانطور که در شکل ۱ نشان داده شده است ، مدل روش پیشنهادی عمدتاً از سه لایه تشکیل شده است: یک لایه تعبیه، یک لایه خود توجه و یک لایه توصیه.
اولین لایه لایه جاسازی است که اطلاعات اولیه را در ویژگی های ابعادی خاصی جاسازی می کند. مسیرهای کاربر، از جمله ویژگی های شناسه کاربر، شناسه نقطه ورود، زمان ورود، ماه ورود و دسته بندی نقطه ورود، به ماتریس مسیر کاربر تبدیل می شوند. سپس، ماتریس مکانی-زمانی مسیر از اطلاعات مکانی-زمانی ماتریس مسیر کاربر و ماتریس مکانی-زمانی POI از اطلاعات مکانی-زمانی مسیر کاربر و POI های نامزد محاسبه می شود. در نتیجه، سه ماتریس مهم، یعنی ماتریس مسیر کاربر، ماتریس فضایی-زمانی مسیر و ماتریس مکانی-زمانی POI از لایه اول مشتق می شوند. لایه دوم، لایه توجه به خود است که هدف آن یادگیری ویژگی های ترجیحی کاربر است. به طور خاص، ماتریس مسیر کاربر و ماتریس فضایی-زمانی مسیر بهدستآمده از لایه اول به شبکه خود توجه ارسال میشوند تا ترجیحات کاربر را یاد بگیرند. لایه سوم لایه توصیه است که در آن POI بعدی با ویژگی های ترجیحی کاربر آموخته شده توصیه می شود. جزئیات این لایه ها در قسمت های بعدی توضیح داده شده است.
۴٫۱٫ لایه جاسازی
ورودی های لایه تعبیه مسیرها هستند اسn= {پ۱،پ۲، ⋯،پ|اسn|}��={�۱,�۲,⋯،پ|اس�|}از هر کاربر، کجا پمن=<تومن،لک،تیک،مترک،جک>پمن=<تومن،لک،تیک،مترک،جک>آن کاربر را نشان می دهد تومنتومنثبت نام کرد لکلکPOI در زمان تیکتیک، دسته بندی POI است جکجک، و ماهی که در آن اعلام حضور رخ داده است مترکمترک. با توجه به این ورودی ها، لایه تعبیه شده این مسیرها را در فضای پنهان قرار می دهد و ویژگی های آنها را به دست می آورد. به طور خاص، هر نقطه در مسیرها بر اساس پنج نوع ویژگی خود به یک ویژگی d -dimension نگاشت می شود. هنگامی که ویژگی های هر نقطه از مسیرها به دست آمد، رابطه مکانی-زمانی بین نقاط مختلف در مسیرها و بین POI فعلی کاربران و POI های نامزد محاسبه می شود. این به این دلیل است که زمینه مکانی-زمانی تأثیر زیادی بر انتخاب POI بعدی دارد و این اطلاعات به آگاهی از اولویت کاربر در زمینه مکانی-زمانی کمک می کند.
پس از تعبیه، مسیر اسn={پ۱،پ۲، ⋯،پ|اسn|}اس�={پ۱،پ۲،⋯،پ|اس�|}از هر کاربر به یک ماتریس به شکل تبدیل می شود {ه۱n،ه۲n، ⋯،هنn} ∈آرن× d{ه�۱،ه�۲،⋯،ه�ن}∈آرن×د، جایی که همنnه�مننشان دهنده ویژگی های نقطه مسیر من است. از آنجایی که هر نقطه در مسیر شامل پنج نوع ویژگی شناسه کاربر، شناسه نقطه ورود، زمان ورود، ماه ورود و دسته بندی نقطه ورود است، ویژگی های نقطه مسیر i-ام. همنnه�منافزوده شدن ویژگی های این صفات است. به این معنا که، همنn=هتوn+هلn+هتیn+همترn+هجn∈آرده�من=ه�تو+ه�ل+ه�تی+ه�متر+ه�ج∈آرد، جایی که هتوnه�تو، هلnه�ل، هتیnه�تی، همترnه�متر، و هجnه�جویژگی های تعبیه شده این ویژگی ها به ترتیب شناسه کاربری، شناسه نقطه ورود، زمان ورود، ماه ورود و دسته بندی نقطه ورود هستند و d بعد این ویژگی های تعبیه شده است. برای مقادیر این ویژگی ها، آنها در عمل اعداد هستند. بنابراین، ما آنها را از یک اسکالر به یک بردار متراکم تبدیل می کنیم. آنچه باید توجه داشت این است که مقادیر زمان ورود به زمان ۷ (روز) × ۲۴ (ساعت) = ۱۶۸ (ساعت) تبدیل شده است که نشان دهنده یک ساعت در هفته است. این اطلاعات زمانی دقیق به منظور برجسته کردن ماهیت چرخه ای بالقوه زندگی افراد در طول هفته است.
برای بدست آوردن رابطه مکانی-زمانی بین نقاط مختلف در مسیرها، فواصل مکانی و فواصل زمانی زمانی بین نقاط مختلف محاسبه میشوند. فواصل مکانی بین نقاط با روش محدوده هاورسین [ ۳۳ ] به دست می آید. تفاوت مطلق بین ویژگی های تعبیه شده زمان ورود به دو نقطه مختلف به عنوان فاصله زمانی زمانی بین نقاط در نظر گرفته می شود. سپس، فاصله مکانی و فاصله زمانی بین دو نقطه با هم جمع میشوند تا رابطه مکانی-زمانی بین دو نقطه از مسیرها به دست آید. به این ترتیب برای هر مسیر یک ماتریس متناظر به شکل وجود دارد آرن× Nآرن×نبرای به دست آوردن رابطه مکانی-زمانی بین هر دو نقطه از مسیر. به همین ترتیب، رابطه مکانی-زمانی بین مکان فعلی کاربر و POIهای کاندید برای توصیه ها را می توان دریافت کرد. در نهایت، سه نوع ماتریس توسط لایه های تعبیه شده به دست می آید. آنها ماتریس مسیر کاربر هستند که ویژگیهای مسیرهای کاربران مختلف را به تصویر میکشند، ماتریس مکانی-زمانی مسیری که روابط مکانی-زمانی بین نقاط مسیر را نشان میدهد، و ماتریس مکانی-زمانی POI که روابط مکانی-زمانی بین را نشان میدهد. مکان فعلی کاربر و POIهای نامزد.
۴٫۲٫ لایه توجه به خود
انتقال کاربر بین نقاط ورود، ترجیحات عادت روزانه آنها را منعکس می کند، و استخراج ترجیحات شخصی آنها به توصیه POI بعدی به کاربر کمک می کند. مدلهای شبکه عصبی سنتی مانند LSTM و RNN نمیتوانند اطلاعات توالی طولانی را ضبط کنند، اما برای به دست آوردن رفتار شخصی و ترجیحات عادت، مسیرهای توالی طولانی مورد نیاز است. شبکه خود توجه از مکانیسم توجه برای محاسبه همبستگی بین POIها استفاده می کند. این لایه ماتریس مسیر کاربر و ماتریس فضایی-زمانی مسیر را به عنوان ورودی می گیرد تا ویژگی های ترجیحی کاربر را یاد بگیرد. با توجه به ماتریس مسیر کاربر م( u ) ∈آرن× dم(تو)∈آرن×دو ماتریس مکانی-زمانی مسیر م( Δ ) ∈آرن× Nم(Δ)∈آرن×ن، عبارت یادگیری ترجیحی این است:
αمنαمنوزن تشابه معنایی بین POI است که به صورت زیر محاسبه می شود:
که در آن Q ، K و V به ترتیب نشان دهنده ماتریس های پرس و جو، کلید و ارزش در شبکه توجه به خود هستند. ابتدا حاصل ضرب نقطه ای ماتریس های Q و را محاسبه می کنیمکتیکتی، ماتریس مکانی-زمانی مسیر را برای تأکید بر اطلاعات مکانی-زمانی اضافه کنید و اعمال کنید د–√دبرای مقیاس بندی نتایج سپس، نتایج با استفاده از عملیات softmax به یک توزیع احتمال نرمال می شوند. Q ، K و V به صورت زیر تعریف می شوند، جایی کهدبلیوس،دبلیوک،دبلیوV∈آرد× dدبلیوس،دبلیوک،دبلیو�∈آرد×دماتریس های پارامتر هستند.
۴٫۳٫ لایه توصیه
ترجیحات کاربر در لایه توجه به خود آموخته می شود. با ویژگیهای ترجیحی کاربر آموختهشده، لایه توصیه اولویت کاربر را با POI هر نامزد مطابقت میدهد و POI را با درجه تطبیق بالا توصیه میکند. برای انتخاب POI های نامزد، همه POI های باقی مانده اغلب به عنوان نامزد در نظر گرفته می شوند. در این مقاله از یک فیلتر POI کاندید برای حذف نامزدها استفاده شده است که فاصله بیشتری با آنها دارند.
با توجه به مجموعه داده NYC و مجموعه داده TKY [ ۳۴ ]، آمار توزیع فاصله بین POI در شکل ۲ نشان داده شده است. شکل ۲ a توزیع فاصله بین دو بازدید متوالی در مجموعه داده NYC را نشان می دهد و شکل ۲ a مجموعه داده TKY را نشان می دهد. مشاهده می شود که فاصله بین اکثر بازدیدهای متوالی از ۲۵ کیلومتر بیشتر نمی شود. بنابراین، POI های کاندید، که بیش از ۲۵ کیلومتر با POI فعلی فاصله دارند، از توصیه ها برای بهبود دقت توصیه حذف می شوند.
پس از فیلتر کردن، ماتریس مکانی-زمانی POI تغییر می کند م( سی) ∈آرL × Nم(سی)∈آر�×نبه م(سی“) ∈آرL“× Nم(سی”)∈آر�”×ن. سپس، احتمالات هر POI کاندید برای توصیه به روش زیر محاسبه می شود:
جایی که س ، ک∈آرن× dس،ک∈آرن×ددر فرمول (۳) و اسu m ( ∙ )استومتر(•)مجموع مقادیر آخرین بعد است. احتمالات از بزرگترین به کوچکترین مرتبسازی میشوند و POI با بالاترین احتمال توصیه میشود.
۵٫ آزمایش ها و نتایج
در این بخش، جزئیات آزمایش های مورد استفاده برای اعتبارسنجی روش پیشنهادی ارائه شده است. تنظیمات آزمایشی، مقایسه نتایج با سایر روشهای مرتبط، و نتایج آزمایش فرسایش شرح داده شدهاند.
۵٫۱٫ راه اندازی آزمایشی
۵٫۱٫۱٫ مجموعه داده ها
برای اعتبارسنجی روش پیشنهادی، از دو مجموعه داده عمومی NYC [ ۳۴ ] و TKY [ ۳۴ ] در آزمایشهای ما استفاده شد. اطلاعات موجود در هر مجموعه داده شامل شناسه کاربر، شناسه POI، زمان ورود، ماه ورود و دسته بندی نقطه ورود بود. ما تمام سوابق ورود را ظرف یک سال جمع آوری کردیم. ما POI هایی را که کمتر از ۱۰ بار بررسی شده بودند به عنوان نقاط ورود به سیستم “زامبی” در نظر گرفتیم، کاربرانی که طول مسیر آنها کمتر از ۲۰ بود به عنوان کاربران بسیار غیرفعال در نظر گرفتیم و چنین POI و کاربرانی را از مجموعه داده حذف کردیم. در نهایت، تعداد کاربران، POI ها و دسته بندی های POI مجموعه داده ها در جدول ۱ نشان داده شده است.
برای آموزش شبکه توجه به خود، اولین ن– ۳ن-۳نقاط چک در مسیر یک کاربر به عنوان ورودی، و مربوطه استفاده شد ن– ۲ن-۲نقاط ورود به عنوان برچسب استفاده شد. برای مجموعه اعتبارسنجی، ن– ۲ن-۲-مین نقطه ورود به عنوان ورودی در نظر گرفته شد و ن– ۱ن-۱-مین نقطه ورود به عنوان برچسب گرفته شد. هنگام آزمایش، ن– ۱ن-۱-مین نقطه ورود در مجموعه آزمایشی به عنوان ورودی برای پیش بینی یک نقطه مورد علاقه در مکان N- ام در نظر گرفته شد .
۵٫۱٫۲٫ خطوط پایه
برای نشان دادن عملکرد بهبود یافته، روشهای مرتبط زیر را برای مقایسه انتخاب کردیم.
-
LSTM [ ۹ ] (Hochreiter et al., 1997): این یک مدل RNN ویژه است که شامل یک سلول حافظه و سه دروازه ضربی برای یادگیری ترجیحات طولانی مدت است.
-
RNN [ ۸ ] (Zhang et al., 2014): یک چارچوب جدید مبتنی بر شبکه عصبی مکرر پیشنهاد شده است. این چارچوب وابستگی بین رفتار توالی کاربر را مستقیماً به فرآیند پیشبینی کلیک از طریق ساختار تکرارشونده در RNN مدل میکند.
-
GRU [ ۳۵ ] (چو و همکاران، ۲۰۱۴): این رویکرد از دو شبکه عصبی بازگشتی تشکیل شده است. یک RNN دنباله ای از نمادها را در یک نمایش برداری با طول ثابت رمزگذاری می کند و RNN دیگر آن نمایش را به دنباله دیگری از نمادها رمزگشایی می کند.
-
ST-RNN [ ۳۶ ] (Liu et al., 2016): این یک شبکه عصبی بازگشتی مکانی-زمانی است که می تواند بافت زمانی و مکانی محلی هر لایه را با ماتریس های انتقال زمانی خاص برای بازه های زمانی مختلف و ماتریس های انتقال فاصله خاص مدل کند. برای فواصل جغرافیایی مختلف
-
Bi-STDDP [ ۳۷ ] (Xi et al., 2019): این روش وابستگیهای مکانی-زمانی دو جهته و اولویتهای کاربر پویا را برای شناسایی بررسیهای POI که کاربران در یک زمان خاص به آن دسترسی دارند، یکپارچه میکند.
-
GeoSAN [ ۱۱ ] (Lian et al., 2020): این یک روش توصیه مکان برای توصیه توالی آگاه از زمین بر اساس یک شبکه خودآگاه است. یک ژئوکدر مبتنی بر توجه برای نشان دادن یک فرآیند شبکه سلسله مراتبی برای هر نقطه GPS استفاده می شود.
-
LSTPM [ ۲۷ ] (Sun et al., 2020): این یک روش توصیه POI بعدی است که ترجیحات بلند مدت و کوتاه مدت را ترکیب می کند. به طور خاص، این مدل شامل یک شبکه غیرمحلی برای مدلسازی ترجیحی بلندمدت و یک RNN جغرافیایی گسترده برای یادگیری ترجیحی کوتاهمدت است.
-
STAN [ ۲۶ ] (Luo et al., 2021): این روش به صراحت از اطلاعات مکانی-زمانی نسبی همه شبکهها با لایههای خودآگاه در طول مسیر بهرهبرداری میکند. این بهبود امکان تعامل نقطه به نقطه بین مکانهای غیر مجاور و بررسیهای غیرمرتبط با اثرات مکانی-زمانی صریح را فراهم میکند.
-
RTPM [ ۲۸ ] (Liu et al., 2021): این یک مدل استخراج ترجیحی زمان واقعی مبتنی بر LSTM است که می تواند برای توصیه POI محدود به زمان بعدی استفاده شود. به طور خاص، ترجیحات بلادرنگ کاربران را از اولویت های بلند مدت و کوتاه مدت در یک چارچوب یکپارچه استخراج می کند.
۵٫۱٫۳٫ شاخص های ارزیابی و جزئیات پیاده سازی
برای اندازه گیری عملکرد، معیاری که معمولاً در سیستم توصیه استفاده می شود R e c @ Kآرهج@کدر این مقاله به تصویب رسید. Rec@K نسبت POI های صحیح در بین K POI های توصیه شده برتر به حقیقت پایه است. مانند معادله زیر ( ۵ ) محاسبه می شود، که در آن K تعداد POI های توصیه شده را نشان می دهد. آرتو( ک )آرتو(ک)فهرستی از POI های توصیه شده را نشان می دهد و تی( تو )تی(تو)نشان دهنده لیست های بازدید شده توسط کاربران است. به طور خاص، سه معیار مشخص از R e c @ ۱آرهج@۱، R e c @ ۵آرهج@۵، و R e c @ ۱۰آرهج@۱۰استفاده شد، با تعداد بزرگتر نشان دهنده اثر قوی تر است. یافته های آزمون در پنج آزمایش به طور میانگین محاسبه شد.
ما روش پیشنهادی را با چارچوب یادگیری عمیق PyTorch پیاده سازی کردیم. آزمایشها تحت لینوکس با نسخه ۱۰٫۱ Cuda، نسخه ۱٫۶٫۰ PyTorch و نسخه ۳٫۸ پایتون اجرا شدند و GPU NVIDIA Tesla T4 بود. بهینه ساز مورد استفاده، بهینه ساز Adam بود. میزان یادگیری اولیه ۰٫۰۰۰۱ و افت تحصیلی ۰٫۲ تعیین شد. بعد جاسازی NYC و TKY روی ۵۰، طول مسیر NYC روی ۱۲۰، طول مسیر TKY روی ۱۰۰ و دوره آموزشی ۱۵۰ تنظیم شد.
۵٫۲٫ نتایج تجربی و تجزیه و تحلیل
نتایج مقایسه با سایر روش های مرتبط در جدول ۲ نشان داده شده است. دادههای عملکرد روشهای LSTM، RNN، GRU، STRNN، و Bi-STDDP از کار Bi-STDDP [ ۳۷ ]، دادههای عملکرد GeoSAN و STAN از کار STAN [ ۲۶ ] و داده های LSTPM و RTPM از کار RTPM [ ۲۸ ] است. داده های از دست رفته با “-” جایگزین می شوند. در مقایسه، نتیجه بهینه با “_” تاکید می شود. نتایج مقایسه نشان داد که روش پیشنهادی در این مقاله از نظر سه معیار بر اساس دو مجموعه داده بهتر عمل میکند.
مدل ما به طور قابل توجهی از همه مدلهایی که با آنها مقایسه شده بود، با بهبود ۹ تا ۱۷ درصدی در نرخ فراخوان عملکرد بهتری داشت. این روش همچنین در مجموعه داده نیویورک بهتر عمل کرد. این به این دلیل است که بیش از نیمی از مسیرهای موجود در مجموعه داده کمتر از ۱۰۰ طول داشتند. در این مورد روش ابداعی ما مؤثرتر بود. با مقایسه نتایج دو مجموعه داده، مشخص شد که تنها روش ما، روش GeoSAN و روش STAN روی مجموعه داده NYC بهتر عمل کردند. دلیل این امر این است که هر سه روش از شبکههای توجه به خود استفاده میکردند که در ثبت ویژگیهای توالی طولانی بهتر بودند. روش ما برتر بود زیرا اطلاعات ویژگی های بیشتری را برای به دست آوردن تصویر دقیق تری از تنظیمات برگزیده کاربر اضافه کردیم. امکانات فیلترهای مکان نامزد نیز نقش مهمی ایفا کرد.
از بین سه روش با استفاده از شبکه های خودتوجهی، روش پیشنهادی در این مقاله بهترین و GeoSAN بدترین عملکرد را داشته است. دلیل این امر ممکن است این باشد که پیشآموزش ژئوکدر GeoSAN ناکافی بوده و اطلاعات مربوط به نمونهگیر منفی کافی نبود. علاوه بر این، مشخص شد که شبکه STAN نسبت به Bi-STDDP و LSTPM در مجموعه داده TKY پایینتر است. دلایل ممکن است مدل سازی ناکافی اطلاعات جغرافیایی و اندازه بزرگتر مجموعه داده TKY باشد. عملکرد کلی روش RTPM عالی بود Rec@1 عالی بوددر هر دو مجموعه داده، احتمالاً به این دلیل که شبکه تناوب شبکههای LSTM را محاسبه میکند و رابطه بین ترجیحات تاریخی کاربران و ترجیحات فعلی را بر اساس شباهت مکانی-زمانی آنها استخراج میکند. علاوه بر این، همچنین در نظر گرفت که ترجیحات فعلی کاربران ممکن است تحت تأثیر عموم قرار گیرد، بنابراین POI های نامطلوب را فیلتر کرد.
۵٫۳٫ آزمایشات فرسایشی
مجموعهای از آزمایشهای فرسایشی نیز در این مقاله انجام شد تا ارزش پیشرفتهای ما برجسته شود. جدول ۳نتایج آزمایشها را نشان میدهد: “-MCF” نشاندهنده حذف ویژگیهای ماه ورود و دسته بندی نقطه ورود، و همچنین فیلتر POI نامزد است. “-M” نشان دهنده حذف ویژگی ماه ورود است. “-C” نشان دهنده حذف ویژگی دسته نقطه ورود است. و “-F” نشان دهنده حذف فیلتر POI نامزد است. مقایسه سهم پیشرفت های مختلف را نشان می دهد. به عنوان مثال، هنگام افزودن ویژگی ماه ورود بر اساس مجموعه داده TKY، دقت توصیه را به طور متوسط ۱۱٫۰۷٪ بهبود داد، در حالی که هنگام افزودن ویژگی نقطه ورود، دقت توصیه به طور متوسط ۷٫۸۳٪ بهبود یافت. دسته بر اساس مجموعه داده نیویورک.
به ویژه، به دلیل اینکه فاصله بین بیشتر مکانهای اعلام حضور متوالی در مجموعه دادههای NYC و TKY از ۲۵ کیلومتر تجاوز نمیکند، ما یک فیلتر POI نامزد طراحی کردیم تا POIهای نامزد را در فاصله بیش از ۲۵ کیلومتری از مکان فعلی کاربر حذف کنیم. مشاهده می شود که گنجاندن این فیلتر عملکرد توصیه را تا ۶٫۴۶% بهبود می بخشد. هنگام مقایسه دو مجموعه داده، بهبود در مجموعه داده TKY، به ویژه برای شاخص بهتر بود R e c @ ۱آرهج@۱، که ۱۳٫۱۲ درصد بهبود یافته است. این به دلیل اندازه بزرگتر مجموعه داده TKY است که تعداد سایت های کاندید بیشتری داشت. از این رو، بسیاری از نامزدها برای توصیه فیلتر شدند.
۵٫۴٫ تجزیه و تحلیل حساسیت پارامتر
۵٫۴٫۱٫ تنظیم طول آهنگ
ما می دانیم که هر چه داده ها پراکنده تر باشند، یادگیری ترجیحات کاربر دشوارتر است. برای طول مسیر کوتاه تر، یادگیری دقیق ترجیحات کاربر نیز دشوار است. برعکس، هرچه طول مسیر طولانیتر باشد، میتوان به اولویت کاربر دقیقتر دست یافت. با این حال، اگر طول مسیر بیش از حد طولانی تنظیم شود، منجر به صفر شدن بخشی از داده ها می شود که نتایج تجربی را نیز تحت تأثیر قرار می دهد. شکل ۳ توزیع طول مسیر دو مجموعه داده را نشان می دهد. با توجه به اینکه طول مسیر واقعی |اسn||اس�|اکثر کاربران در هر دو مجموعه داده کمتر از ۱۵۰ هستند، ما تأثیر طول مسیر را با مشاهده دقت های مختلف زمانی که طول مسیر N در محدوده ۶۰-۱۵۰ تغییر می کرد، ارزیابی کردیم.
نتایج تجربی در شکل ۴ نشان داده شده است. رنگ قرمز در شکل نتایج آزمایشی مجموعه داده NYC را نشان می دهد و رنگ آبی نشان دهنده نتایج تجربی مجموعه داده TKY است که در آن مختصات افقی شکل تنظیم طول مسیر و مختصات عمودی نرخ فراخوانی است. برای مجموعه داده NYC، مشاهده کردیم که اثر تجربی یک روند افزایشی کلی را با افزایش طول مسیر نشان داد و پس از طول N از ۱۲۰ یکسان شد، بنابراین طول مسیر کاربر مجموعه داده NYC روی N = ۱۲۰ ثابت شد. داده TKY، بدیهی است که اثر تجربی به تدریج با افزایش طول مسیر افزایش یافته و در طول به اوج می رسد.N از ۱۰۰، بنابراین طول مسیر کاربر مجموعه داده TKY در این مقاله به N = ۱۰۰ ثابت شد.
از نتایج آماری نشان داده شده در شکل ۳ ، می توانیم ببینیم که در مجموعه داده TKY، بیش از نیمی از طول مسیر واقعی کاربران |اسn||اس�|بیشتر از ۱۲۰ هستند و اقدامات کاربر نسبتاً متراکم بود. برعکس، در مجموعه داده نیویورک، بیش از نیمی از طول مسیر واقعی کاربران است |اسn||اس�|کمتر از ۱۲۰ هستند و اقدامات کاربر نسبتاً پراکنده بود. این ممکن است دلیلی باشد که بهترین دقت برای مجموعه داده TKY با تنظیم طول مسیر روی N = ۱۲۰ و برای مجموعه داده NYC با تنظیم طول مسیر روی N = ۱۰۰ به دست آمده است.
۵٫۴٫۲٫ تنظیم ابعاد جاسازی
برای انتخاب ابعاد ویژگی در لایه جاسازی (به بخش ۴٫۱ مراجعه کنید )، مقادیر ۱۰، ۲۰، ۳۰، ۴۰، ۵۰، ۶۰، و ۷۰ را روی دو مجموعه داده آزمایش کردیم و نتایج تجربی در شکل ۵ نشان داده شده است. رنگ قرمز در شکل نشان دهنده نتایج تجربی مجموعه داده NYC و رنگ آبی نشان دهنده نتایج تجربی مجموعه داده TKY است. بدیهی است که اثر آزمایشی به تدریج با افزایش بعد تعبیه بهبود یافت، در بعد ۵۰ به اوج رسید و سپس تمایل به پایدار ماندن داشت. بنابراین، ما بعد تعبیه را در روش خود ۵۰ قرار دادیم.
۶٫ نتیجه گیری
این مقاله یک روش توصیه POI بعدی را بر اساس یک شبکه توجه به خود پیشنهاد می کند. در حال حاضر، روشهای پیشنهادی POI بعدی عمدتاً از یادگیری عمیق برای گرفتن ترجیحات کاربر با یادگیری روابط غیرخطی بین POI و ترجیح کاربر استفاده میکنند. متفاوت از این روشها، روش پیشنهادی به صراحت اطلاعاتی را که میتواند ترجیحات کاربر را منعکس کند، در فرآیند یادگیری دریافت کند تا ترجیحات کاربر را بهتر به تصویر بکشد. با توجه به اینکه کار و زندگی افراد اغلب در قالب دوره ای سازماندهی می شود، ما ویژگی ماه ورود را به عنوان محدودیت برای توصیه POI بعدی انتخاب کردیم. آزمایشها نشان داد که این دقت روش را ۱۱٫۳۷ درصد در هر دو مجموعه داده بهبود میبخشد. بر اساس این واقعیت که دسته های POI می توانند ترجیحات کاربر را نیز منعکس کنند، ما همچنین از ویژگی دستههای POI برای توصیههای بعدی POI استفاده کردیم و آزمایشها نشان داد که آن نیز سهم مثبتی در نتایج داشته است. علاوه بر این، فاصله بر تصمیم گیری افراد در مورد بازدید یا عدم بازدید از یک POI تأثیر می گذارد. بنابراین، ما از یک فیلتر برای حذف POIهای نامزدی استفاده کردیم که در هنگام توصیه POIهای بعدی بیش از فاصله معینی دور بودند. آزمایشها نشان داد که این امر دقت توصیهها را تا حد زیادی بهبود میبخشد.
در آینده، ادغام دادههای POI بیشتر [ ۳۸ ] را در نظر خواهیم گرفت، با استفاده از انواع بیشتری از اطلاعات موجود که ممکن است به صراحت ترجیحات کاربر را نشان دهد [ ۳۹ ] – مانند کاربرانی که دنبال میکنند و دنبال میشوند و محلههای کاربر پسند – برای توصیه بعدی POI به عملکرد روش را بیشتر بهبود بخشد.