SocialMedia2Traffic: استخراج اطلاعات ترافیک از داده های رسانه های اجتماعی


چکیده

پیش‌بینی ترافیک موضوعی است که برای تحقیقات و کاربردها در حوزه مسیریابی و ناوبری اهمیت فزاینده‌ای دارد. متاسفانه داده های باز به ندرت برای این منظور در دسترس هستند. برای غلبه بر این موضوع، نویسندگان امکان استفاده از داده‌های رسانه‌های اجتماعی برچسب‌گذاری‌شده جغرافیایی (توئیتر)، داده‌های مربوط به استفاده از زمین و نقاط مورد علاقه پوشش زمین (از OpenStreetMap) و یک معیار مرکزیت بین‌المللی اقتباس‌شده را به عنوان فضاهای ویژگی برای پیش‌بینی تراکم ترافیک بررسی کردند. از یازده شهر جهان چارچوب و گردش کار ارائه شده به عنوان SocialMedia2Traffic نامیده می شود. تراکم ترافیک در چهار وضوح فضایی پیش‌بینی شد و با داده‌های Uber Movement مقایسه شد. دقت کلی پیش‌بینی برای مناطق پر ترافیک تقریباً ۸۱ درصد بود. مراحل مختلف پردازش داده ها از جمله راه هایی برای جمع آوری نقاط داده، پروکسی های مختلف و رویکردهای یادگیری ماشین مقایسه شدند. فقدان یک تعریف جهانی در مقیاس جهانی برای طبقه‌بندی بخش‌های جاده توسط سطل‌های سرعت در کلاس‌های مختلف تراکم ترافیک به عنوان یک محدودیت عمده در قابلیت انتقال چارچوب شناخته شده است. به طور کلی، SocialMedia2Traffic قابلیت استفاده از فضای ویژگی آزمایش شده را برای پیش بینی ترافیک بیشتر بهبود می بخشد. یک مزیت دیگر ماهیت آگنوستیک رویکرد پلتفرم رسانه اجتماعی است. SocialMedia2Traffic بیشتر قابلیت استفاده از فضای ویژگی آزمایش شده را برای پیش بینی ترافیک بهبود می بخشد. یک مزیت دیگر ماهیت آگنوستیک رویکرد پلتفرم رسانه اجتماعی است. SocialMedia2Traffic بیشتر قابلیت استفاده از فضای ویژگی آزمایش شده را برای پیش بینی ترافیک بهبود می بخشد. یک مزیت دیگر ماهیت آگنوستیک رویکرد پلتفرم رسانه اجتماعی است.

کلید واژه ها:

تردد وسایل نقلیه ؛ رسانه های اجتماعی ؛ توییتر ؛ OpenStreetMap ; جنبش اوبر ؛ طبقه بندی ; پیش بینی ترافیک ؛ فراگیری ماشین

۱٫ مقدمه

توانایی نظارت، تجزیه و تحلیل، تجسم و پیش‌بینی حرکت ترافیک شهری در سال‌های گذشته به دلیل افزایش ناگهانی دستگاه‌های مجهز به GNSS (سیستم ناوبری ماهواره‌ای جهانی) مانند تلفن‌های هوشمند افزایش یافته است [ ۱ ، ۲ ]. به عنوان مثال، ناوگان ون های تحویلی مجهز به GNSS، یکی از این منابع داده است که امکان نظارت بر تراکم ترافیک در زمان واقعی در شهرهای شهری را ممکن می سازد. چنین داده هایی محبوبیت نقشه برداری ترافیک در حالت کمی را در میان گروه های تحقیقاتی افزایش داده است [ ۳ ، ۴ ، ۵]. ترافیک وسایل نقلیه به ویژه با استفاده از چنین داده هایی به دلیل تأثیر مستقیم آن بر اقتصاد و معیشت به طور گسترده مورد مطالعه قرار گرفته است. با این حال، مطالعات موجود به دلیل کمیاب بودن پوشش داده‌ها، پروکسی‌های مقیاس‌پذیر و اعتبارسنجی حقیقت پایه، همیشه به مناطق مطالعاتی کوچک محدود شده‌اند [ ۶ ]]. همه ارائه دهندگان عمده داده های ترافیکی در حال حاضر یا شرکت های خصوصی یا ارگان های دولتی هستند. بنابراین، داده‌ها به طور کلی برای علم و تحقیق در دسترس عموم قرار نمی‌گیرند-محققان برای دسترسی به آنها به حسن نیت سازمان‌های صاحب داده‌ها یا منابع مالی کافی وابسته هستند. این امر نیاز روزافزونی به مجموعه داده‌های جغرافیایی ارزان، در دسترس عموم، برای پیش‌بینی ترافیک با وضوح مکانی و زمانی قابل‌توجه ایجاد می‌کند. چنین مجموعه‌های داده همچنین می‌توانند برای پشتیبانی از سؤالات تحقیقاتی مشابه مربوط به انتشار CO ۲ ، برنامه‌ریزی شهری، اهداف پایدار و رفاه کلی ساکنان شهری استفاده شوند [ ۷ ].
غول‌های فناوری اطلاعات مانند Google، Yandex، HERE، Mapbox و غیره، در درجه اول به داده‌های دورسنجی برای انجام تخمین ترافیک در مقیاس جهانی متکی هستند [ ۸ ، ۹ ]. بنابراین، جمع‌آوری داده‌ها یا از طریق API آنها (رابط برنامه‌نویسی برنامه)، از طریق SDK (کیت توسعه نرم‌افزار) نصب شده بر روی دستگاه‌های تلفن همراه کاربر مختلف یا از طریق برخی از ارائه‌دهندگان شخص ثالث مانند ناوگان ون‌های تحویل دارای GNSS انجام می‌شود [ ۸ ، ۱۰ ]. مقدار داده‌های تله‌متری جمع‌آوری‌شده به ترتیب میلیون‌ها نقطه داده است، همانطور که Mapbox در سال ۲۰۱۷ گزارش داد، زمانی که این شرکت حدود ۲۰ میلیون نقطه برچسب‌گذاری شده جغرافیایی را برای ایجاد یک نقشه ترافیک جهانی جمع‌آوری کرد.
در دانشگاه، بسیاری از مطالعات منطقه‌ای، قابلیت استفاده از داده‌های رسانه‌های اجتماعی را برای درک تحرک انسان، ناوبری وسایل نقلیه، شهرهای هوشمند و مدل‌سازی شهری بررسی کرده‌اند [ ۱۱ ]. این فعالیت‌ها بر جنبه‌هایی مانند تراکم ترافیک وسایل نقلیه و عابران پیاده یا تخمین‌های ماتریس مبدا-مقصد (OD) متمرکز شده‌اند [ ۱۲ ]. با این حال، بیشتر کار بر اساس استفاده از داده های رسانه ای (متن، تصاویر، فیلم ها و برچسب ها) مرتبط با یک پلت فرم رسانه ای معین بوده است. برای مدل‌سازی ترافیک وسایل نقلیه، اکثر کارها مبتنی بر استفاده از محتوای پیام‌های متنی داده‌های توییتر برای شهرهای منتخب جهان است [ ۱۳ ].]. هسته اصلی این رویکرد جستجوی کلمات کلیدی مرتبط با ترافیک (در مورد توییتر) برای انجام تجزیه و تحلیل احساسات برای شناسایی شرایط ترافیکی در مجاورت است. این شامل متن کاوی و در برخی موارد تولید ماتریس OD است. این نوع رویکردها از نظر قابلیت انتقال به مناطق دیگر با زبان های گفتاری متفاوت دارای محدودیت هایی هستند. علاوه بر این، رویکردها را نمی توان به راحتی به سایر بسترهای رسانه ای منتقل کرد. Coffey [ ۱۴ ] تلاش کرد تا رابطه بین داده‌های BikeShare و انواع پیام‌های توییتی که توسط کاربران در طول سفر ایجاد می‌شود را بیابد. رویکرد اساسی تبدیل داده های تحرک به مجموعه ای از کلمات برای طبقه بندی مجدد بود. یکی دیگر از کارهای اخیر یائو [ ۹] سعی کرد با استخراج خوشه های فضایی از مختصات ارسال توییت، الگوهای تحرک انسان را کشف کند. نشان داده شده است که ویژگی‌های مرتبط با توییت می‌توانند تا حد زیادی پیش‌بینی ترافیک را برای بخش‌های جاده‌ای که تقاضای سفر نقش مهمی در تعیین ازدحام بازی می‌کند، بهبود بخشد [ ۱۵ ، ۱۶ ، ۱۷ ]. ژائو [ ۱۸ ] معیارهای مختلف مرکزیت سازگار را برای تخمین جریان ترافیک بررسی کرد. او علاوه بر مدل‌سازی شبکه با استفاده از نمودارهای اولیه و دوگانه، شبکه را بر اساس گروه‌هایی از خیابان‌های متراکم متصل، شبیه به مدل شبکه جاده‌ای مبتنی بر جامعه، مدل‌سازی کرد. او همچنین تأثیر مدل‌های شبکه را بر تخمین جریان ترافیک بررسی کرد.
Steiger [ ۱۹ ] اظهار داشت که «محتوای متنی توییت‌ها که توسط کاربر تولید می‌شود، پر سر و صدا است، و استفاده از تکنیک‌های پردازش زبان طبیعی (NLP) برای شناسایی اطلاعات معنادار را چالش‌برانگیز می‌کند». او چند الگوی روزانه تکرار شونده را با ویژگی‌های اختلال وابسته به زمان مشابه در امتداد جاده‌های شریانی (حلقه‌ای) اصلی (مشابه مرکزیت جاده)، به عنوان شاخصی برای رفتار تحرک شناسایی کرد. گائو [ ۲۰] به طور جالبی با استفاده از مرکزیت بین‌المللی برای پیش‌بینی ترافیک مخالفت کرد و گزارش داد که به دلیل تغییر شکل و دامنه در مناطق مورد مطالعه، شاخص پایداری نیست. برای دستیابی به سفرهای OD واقعی‌تر، او از اثر فاصله- فروپاشی برای وزن بیشتر به مسافت‌های کوتاه به جای طولانی استفاده کرد. مطالعه قابل توجه دیگری در مورد این موضوع از Pun [ ۲۱ ] و Giles [ ۲۲ ] انجام شد که جریان ترافیک را بر اساس سه نوع اطلاعات جریان ترافیک، یعنی میانگین ترافیک روزانه سالانه (AADT)، ترافیک عمومی و ترافیک خصوصی مدلسازی کردند. آنها بیشتر تجزیه و تحلیل کردند که چگونه تراکم جمعیت OD بر تعداد سفرها در هر مسیر در روز تأثیر می گذارد.
در این مطالعه، امکان استفاده از داده‌های رسانه‌های اجتماعی برچسب‌گذاری‌شده جغرافیایی به همراه یک معیار مرکزیت بین جاده‌ای اقتباس‌شده و تقریبی و فضاهای ویژگی نقطه‌پوشش زمین مورد علاقه (POI)به عنوان یک پروکسی بالقوه برای تراکم ترافیک وسایل نقلیه مورد بررسی قرار گرفت. تلاشی جهانی برای درک بهتری انجام شده است که در آن وضوح مکانی و زمانی مناطق بسیار شلوغ مرتبط با وسایل نقلیه موتوری را می توان پیش بینی کرد. به طور خاص، حالت‌های مختلف شمارش و کمی‌سازی نقاط داده و سایر پروکسی‌های شناسایی‌شده در مقیاس‌های مختلف مورد بررسی قرار گرفته‌اند که این را به یک مطالعه اثبات مفهوم تبدیل می‌کند. نویسندگان چارچوبی را برای استخراج این اطلاعات برای شبکه‌های مختلف خیابان‌های شهری به نام SocialMedia2Traffic (SM2T) ارائه می‌کنند. این چارچوب افزایش آتی مجموعه داده های رسانه های اجتماعی در دسترس عموم را درک می کند، بنابراین بررسی می کند که آیا همه آنها می توانند به طور جمعی برای تقلید از داده های تله متری سایر راه حل های پولی استفاده شوند یا خیر. ما استدلال می کنیم که تجزیه و تحلیل مبتنی بر مکان برای تراکم ترافیک مقیاس پذیرتر و قوی تر است زیرا نیازی به تشخیص احساسات انسانی ندارد. ما یک روش بدون زمینه برای استخراج اطلاعات ترافیک پیشنهاد می کنیم. هدف این رویکرد این است که اطمینان حاصل شود که هر سرویس آینده بر اساس پیش‌بینی‌های آن، در صورتی که یک منبع داده خاص از سرویس خارج شود، مجبور نباشد آفلاین شود – همانطور که تا حدی برای داده‌های توئیتر با برچسب جغرافیایی در سال ۲۰۱۹ اتفاق افتاد، زمانی که این گزینه غیرفعال شد. مختصات مشتق از GNSS را به توییت‌ها متصل کرد و فقط اطلاعات مکان دقیق کمتری را می‌توان اضافه کرد.
دو راه برای استخراج اطلاعات ترافیک از داده های رسانه های اجتماعی تولید شده توسط انسان وجود دارد: (الف) با استفاده از زمینه رسانه تولید شده، و (ب) استفاده از موقعیت مکانی کاربر در طول دوره تولید داده [ ۲۳ ]. رویکرد مبتنی بر زمینه قابل انتقال در بسترهای رسانه های مختلف نیست [ ۲۴ ]، و پیچیده است اما با مقدار محدودی از داده کار می کند. از سوی دیگر، بازیابی ترافیک مبتنی بر مکان، مقیاس‌پذیر است و پیاده‌سازی آن آسان‌تر است، به این معنا که مستقل از هر پلتفرم خاصی باقی می‌ماند و اگر به مقدار کافی ارائه شود، با یک پروکسی قوی استحکام بیشتری نشان می‌دهد [ ۲۵ ، ۲۶ ]]. احتمالاً تعداد نقاط داده‌ای «کافی» برای تجزیه و تحلیل مبتنی بر مکان برای وضوح مشخص، از منطقه‌ای به منطقه دیگر متفاوت است. کارهایی مانند آنچه توسط Wang [ ۲۷ ] ارائه شده است چارچوب مشابهی را برای انجام نقشه برداری ترافیک ارائه می دهد. با این حال، این چارچوب از داده های رسانه های اجتماعی به عنوان یک پروکسی استفاده نمی کند و تنها بر مسیرهای GPS و داده های POI متکی است. Jayasinghe [ ۲۸ ] مناسب بودن معیارهای مرکزیت را برای تخمین جریان ترافیک بررسی کرد. به طور مشابه، ژانگ [ ۲۹] رابطه بین POIهای پوشش زمین کاربری زمین و ازدحام جریان ترافیک در چندین شهر را بررسی کرد. بنابراین، ادبیات از ایده استفاده از رسانه‌های اجتماعی، POI و داده‌های مرکزی برای نقشه‌برداری ترافیک پشتیبانی می‌کند، اگرچه هیچ تلاش ترکیبی برای اندازه‌گیری همه آن در مقیاس جهانی وجود نداشته است. علاوه بر این، چارچوبی برای توسعه نرم افزار به عنوان یک سرویس وجود ندارد.
اهداف این مقاله به شرح زیر است:
  • برای آزمایش وجود یک رابطه مستقیم و همچنین ترکیبی بین داده‌های توئیتر برچسب‌گذاری‌شده جغرافیایی/ POI پوشش زمین کاربری زمین/مرکزیت بین و تراکم ترافیک بالا در جاده‌ها.
  • ارائه چارچوبی برای آموزش مدل و استدلال برازندگی آن برای هدف.
هیچ سرویس وب باز در دسترس نیست که نقشه تراکم ترافیک پویا را در مقیاس جهانی ارائه دهد. یکی از کاربران فوری سرویس SM2T خدمات مسیریابی در دسترس عموم مانند OpenRouteService [ ۳۰ ] است که به شکل زمان تخمینی رسیدن بهتر سود می برد. چنین خدماتی قرار است به بسیاری از بخش‌ها مانند تحویل پیک، برنامه‌ریزی شهری، مدل‌سازی محیطی، انتشار کربن و غیره کمک کند [ ۳۱ ، ۳۲ ، ۳۳ ، ۳۴ ]. مجموعه داده سرعت Uber Movement برای به دست آوردن حقیقت پایه برای شهرهای منتخب جهان در دسترس است (داده ها را می توان از Uber Movement، (c) 2021 Uber Technologies, Inc., San Francisco, CA, USA, [ ۳۵ ] بازیابی کرد.]). هیچ کار بررسی شده با این ماهیت به صورت آنلاین در مقیاس جهانی موجود نیست. چارچوب ارائه شده در اینجا با هدف ارائه داده‌هایی در مورد ازدحام ترافیک بالا در مقیاس جهانی، بر خلاف مناطق آزمایشی کوچکی که مطالعات تحقیقاتی فعلی در حال حاضر ارائه می‌دهند، است. اگرچه دقت و وضوح مکانی/زمانی SM2T به خوبی پشت هر راه حل اختصاصی قرار می گیرد، این باید به عنوان یک مطالعه اولیه برای بررسی امکان در این جهت تلقی شود.
ما رابطه بین داده‌های توییتر و سرعت ترافیک را با استفاده از تنظیمات آزمایشی زیر بررسی کردیم:
  • ما دو پراکسی مبتنی بر توییتر را به عنوان یک پیش بینی آزمایش کردیم: تعداد کاربران در یک بخش جاده و تعداد کاربران در مجاورت.
  • ما از POI های مربوط به کاربری زمین و پوشش زمین به عنوان یک پیش بینی اضافی استفاده کردیم و چهار روش مختلف را برای جمع آوری اطلاعات POI برای یک کاشی معین بررسی کردیم.
  • ما از یک اندازه گیری مرکزیت اقتباس شده به عنوان یک پیش بینی اضافی استفاده کردیم. مرکزیت بین با توجه به مجموعه متفاوتی از POI اندازه گیری شد.
  • ما چهار وضوح فضایی مختلف را برای یک مدل تسلاسیون مبتنی بر شبکه معمولی آزمایش کردیم.
  • ما قطعنامه‌های موضوعی مختلفی را بررسی کردیم: (۱) با استفاده از اطلاعات سرعت ترافیک پیوسته و (۲) استفاده از اطلاعات سرعت ترافیک طبقه‌بندی شده در سه سطح ازدحام.
  • ما عملکرد پنج مدل یادگیری ماشین را آزمایش کردیم.

۲٫ روش ها و داده ها

۲٫۱٫ چارچوب مفهومی

پلتفرم‌های رسانه‌های اجتماعی مختلف اطلاعات را در قالب‌ها و حالت‌های مختلف تولید می‌کنند (به جدول ۱ مراجعه کنید )، که هر نوع تخمین حجم ترافیک را به شدت وابسته به پلتفرم می‌کند. به عنوان مثال، یک مدل مبتنی بر متن یا متن آموزش داده شده بر روی داده های توییتر را نمی توان برای داده های فلیکر مبتنی بر تصویر استفاده کرد. بنابراین، تجزیه و تحلیل مبتنی بر زمینه نیاز به یادگیری ماشینی گسترده برای رسانه خاص دارد که باید ویژگی‌های پلتفرم را در بر بگیرد. از سوی دیگر، مدلی که فقط بر روی داده‌های مکان و مهر زمانی از توییتر آموزش داده شده است، تا زمانی که اطلاعات مربوطه را ارائه می‌کند، می‌تواند در هر پلتفرم دیگری اعمال شود.
می توان انتظار داشت که موقعیت و اتصال بخش های جاده در یک شهر با میانگین حجم ترافیک مرتبط باشد. گمان می رود جاده هایی با اهمیت بالاتر به طور متوسط ​​ترافیک بیشتری نسبت به سایرین دارند. علاوه بر این، ترافیک به جذابیت منطقه بستگی دارد. نویسندگان فرض کرده‌اند که این می‌تواند با استفاده از چگالی POI‌های خاص گرفته شود. فرض بر این بود که تعداد بیشتری از این POI ها به طور مثبت با حجم ترافیک بالاتر مرتبط هستند. فرض بر این بود که جذابیت یک منطقه توسط آن POI ها افزایش می یابد، حتی اگر POI ها مستقیماً با ماشین قابل دسترسی نباشند، به عنوان مثال، اگر POI ها در مناطق عابر پیاده قرار داشته باشند. علاوه بر این عوامل ایستا، حجم ترافیک توسط عوامل پویا شکل می گیرد که به دلیل زمان روز، روز هفته منجر به الگوهای منظم و نامنظم می شود. وجود تعطیلات یا تعطیلات مدرسه یا رویدادهای خاص مانند کار ساختمانی، رویدادهای ورزشی بزرگ، تظاهرات، و غیره. نویسندگان فرض می‌کنند که این عوامل پویا را می‌توان با فعالیت رسانه‌های اجتماعی در پلتفرم توییتر ثبت کرد. این فعالیت‌ها و حجم ترافیک را می‌توان به‌طور مستقیم یا غیرمستقیم بسته به اینکه توییت‌های مسافران (امیدوارم نه رانندگان) در طول سفر یا برای همه کاربران توییتر حاضر در یک منطقه فیلتر شود، به‌طور مستقیم یا غیرمستقیم مرتبط شوند. احتمالاً مورد دوم با کمی تأخیر زمانی به حجم ترافیک مرتبط است. سطح بالاتری از فعالیت‌های رسانه‌های اجتماعی بسته به جهت سفر ممکن است قبل و بعد از حجم ترافیک بالا باشد. اگر حجم ترافیک در یک سطح انباشته زمانی پیش‌بینی شود، این احتمالاً منجر به پیش‌بینی‌های بهتری می‌شود زیرا نوسانات کوتاه‌مدت به طور میانگین محاسبه می‌شوند.
نویسندگان پنج رزولوشن زمانی مختلف را برای تحلیل فعلی مفهوم‌سازی کرده‌اند ( شکل ۱ را ببینید ): لایه ترافیک زنده > لایه تجمعی زمان > لایه تجمعی در روز هفته > لایه تجمعی هفته > لایه محدودیت سرعت OSM . لایه Live Traffic پیش‌بینی‌های ترافیکی را که با استفاده از داده‌های رسانه‌های اجتماعی در زمان واقعی انجام می‌شود، همراه با سایر فضاهای ویژگی نگه می‌دارد. به محض اینکه این لایه خاص قدیمی شود، تمام لایه‌های زیرین به‌جز لایه محدودیت سرعت OSM به‌روزرسانی می‌شود . لایه Time Aggregatedشامل وضعیت ترافیک سطل های زمانی از پیش تعریف شده برای منعکس کننده ساعات رفت و آمد اداری است. لایه Weekdays Aggregated وضعیت ترافیک جمع آوری شده در چهار روز هفته گذشته را نشان می دهد – به عنوان مثال، با جمع آوری وضعیت ترافیک منطقه با جمع آوری چهار دوشنبه آخر اگر کاربر اطلاعات ترافیک دوشنبه را درخواست می کند. به طور مشابه، لایه Week Aggregated ارزش ترافیک را با تجمیع داده‌های هفت روز گذشته، با در نظر گرفتن تمام زمان‌بندی‌ها، حفظ می‌کند. علاوه بر این، در نهایت، اگر برای یک منطقه مشخص اطلاعاتی از هیچ یک از لایه‌های بالا در دسترس نباشد، لایه محدودیت سرعت OSMبرای بازگشت حداکثر سرعت مجاز بزرگراه استفاده می شود. بنابراین، این پشته لایه ترافیک تضمین می کند که کاربر حداقل اطلاعاتی را برای بخش جاده درخواستی دریافت می کند، با بالاترین وزن دادن به لایه ترافیک زنده و وزن نزولی به سمت لایه محدودیت سرعت OSM . پیش‌بینی کلی ترافیک میانگین وزنی تمام این لایه‌ها خواهد بود.
در دسترس بودن نسبتاً بالای رسانه های اجتماعی با وضوح مکانی و زمانی نسبتاً بالا به عنوان یک نیاز برای استفاده قابل اعتماد از پشته لایه ترافیک SM2T انتظار می رفت. از آنجایی که فضاهای ویژگی انتخاب شده مستقیماً فقط بر لایه ترافیک زنده تأثیر می‌گذارند ، بقیه مقاله فقط رابطه بین این دو را بررسی می‌کند.

۲٫۲٫ شهرهای مورد استفاده برای مطالعه موردی

یازده شهر جهان (به جدول ۲ مراجعه کنید ) که داده‌های سرعت Uber برای آنها در دسترس بود، برای آزمایش مدل‌های مختلف انتخاب شدند. جعبه‌های مرزی شهر به ازای مرزهای سطح ۲ مدیر GADM [ ۳۶ ] برای انتخاب و برش مجموعه‌های داده استفاده شد.

۲٫۳٫ داده‌های جنبش اوبر

Uber یک ارائه‌دهنده خدمات تحرک است که اخیراً شروع به ارائه داده‌های سرعت خودروی شهری تحت مجوز Creative Commons Attribution Non-Commercial [ ۳۵ ] کرده است. نویسندگان از آن برای شناسایی بخش های جاده ای پر ترافیک در شهرهای انتخاب شده استفاده کردند. داده ها با شناسه بزرگراه OSM به عنوان یک کلید خارجی ارائه می شوند که امکان تطبیق آن با شبکه جاده ای OSM مربوطه را فراهم می کند. Uber داده های سرعت خودرو را برای بخش هایی از اشیاء جاده ای OSM ارائه می دهد. بخش های جاده با مشخص کردن OSM-id شروع و پایان بخش تعریف می شوند. علاوه بر این، جهت رانندگی نشان داده شده است. برای شهرهای منتخب، میانگین سرعت حرکت متفاوت است، بین ۲۷٫۰ کیلومتر در ساعت برای سائوپائولو و ۵۱٫۵ کیلومتر در ساعت برای سینسیناتی (به جدول ۳ مراجعه کنید ).
برآورد کلاس تراکم ترافیک در هر کاشی بر اساس این داده‌های سرعت خودرو برای مارس ۲۰۱۸ تا نوامبر ۲۰۱۹ بود. هر بخش جاده با استفاده از جدول ۴ به یک کلاس تراکم ترافیک اختصاص داده شد . اشیاء جاده OSM با کاشی ها تلاقی می کردند. برای هر کاشی میانگین وزنی کلاس تراکم ترافیک محاسبه شد. از این رو، طول بخش های جاده ای تقسیم شده به عنوان وزن استفاده شد. از آنجایی که کلاس‌های تراکم ترافیک به‌عنوان ۰، ۱ و ۲ کدگذاری می‌شوند، گرد کردن میانگین وزنی به نزدیک‌ترین عدد صحیح منجر به کلاس تراکم ترافیک تخمینی می‌شود (یعنی HTC، MTC یا LTC). بخش‌های جاده با داده‌های گمشده Uber نادیده گرفته شد.

۲٫۴٫ پروکسی توییتر

برای استفاده از فرمول فاصله برای تولید نقشه های ترافیکی، باید حداقل یک وسیله نقلیه در یک بخش جاده معین برای یک نقطه زمانی خاص با فرکانس تولید داده بالا داشته باشد. به طور کلی، SDK های راه حل های اختصاصی هر ۱۰ ثانیه نقاط داده GNSS را تولید می کنند. برخلاف داده‌های تله‌متری، داده‌های رسانه‌های اجتماعی برچسب‌گذاری‌شده جغرافیایی را نمی‌توان به این روش استفاده کرد زیرا پوشش داده کافی نیست (توئیتر تنها ۱٪ از پوشش جهانی توییت را از طریق API استریم خود ارائه می‌کند) و ماهیت ذاتی که توسط آن تولید می‌شود. کاربر معینی که فید رسانه های اجتماعی را در فاصله زمانی ۱۰ ثانیه یا کمتر تولید می کند، باید به عنوان یک چیز دور از ذهن یا مصنوع در نظر گرفته شود.
در صورت تصمیم کاربر، دو روش وجود دارد که می‌توان موقعیت جغرافیایی را به توییت‌ها متصل کرد: با مختصات و با کلید مکان . کلید مختصات قبل از سال ۲۰۱۹ برای ذخیره مختصات GNSS از دستگاهی که کاربر از آن توییت کرده بود استفاده می شد. حداقل با استفاده از مشتری رسمی توییتر، از سال ۲۰۱۹ دیگر این امکان وجود ندارد. برنامه های شخص ثالث – مانند اینستاگرام – هنوز هم اجازه می دهند کلید پر شود. با این حال، به نظر می‌رسد اینستاگرام از کلید مختصات برای هدف دیگری استفاده می‌کند، نه موقعیت فعلی کاربر، بلکه مختصات را از یک مکان ثابت مشخص شده توسط کاربر [ ۳۷ ]. بنابراین با استفاده از مختصاتاحتمالاً کلید توییت‌های فعلی منجر به نتایج بسیار گمراه‌کننده‌ای می‌شود. این رفتار اینستاگرام قبل از سال ۲۰۱۹ گزارش شده است [ ۳۷ ]. کلید مکان امکان انتخاب مختصات یک مکان با نام تعریف شده توسط توییتر را در نزدیکی مکانی که توییت در آن پست شده است را می دهد. این مکان ها با سطوح مختلفی از دانه بندی ارائه می شوند: دسته بندی ها “کشور”، “شهر” و “poi” هستند.
نویسندگان به داده های توییتر برای مارس ۲۰۱۸ تا نوامبر ۲۰۱۹ از API استریم توییتر دسترسی داشتند. توییت هایی با کلید GeoCoordinates با مختصات GNSS دقیق استفاده شد. تعداد کاربران مجزای توییتر و تعداد توییت‌ها با بیش از یک مرتبه بزرگی بین شهرهای انتخاب شده متفاوت است ( جدول ۳ را ببینید). در دسترس بودن کم داده توییتر با استفاده از دو پراکسی برطرف شد. تعداد کاربر در یک پراکسی شبکه جاده ای بر اساس تمام توییت های موجود در یک بافر معین از یک بخش جاده است ( شکل ۲ الف را ببینید). اندازه بافر بسته به کلاس‌های مختلف جاده OSM انتخاب شد ( جدول ۴ را ببینید). این پراکسی در نظر گرفته شده است که زیرمجموعه ای از جمعیت جاده را که در حین سواری توییت می کنند، ثبت کند، که ممکن است سهم کمی از همه کاربران جاده باشد. در حالی که انتظار می‌رود عرض جاده انواع جاده OSM در کشورهای مختلف متفاوت باشد، از بافرهای یکسانی برای تجزیه و تحلیل در همه شهرهای انتخاب شده استفاده می‌شود. راه دیگر برای تخمین تعداد واقعی کاربران جاده یا وسایل نقلیه در جاده، استفاده از تعداد کاربران در مجاورت (ر.ک. شکل ۲ ب) به عنوان یک پروکسی است. فضاهای عمومی کلیدی (به جدول ۵ مراجعه کنید ) برای انتخاب خوشه های توییت بدون بافر استفاده شد.
نویسندگان دو رویکرد اضافی را برای استخراج اطلاعات ترافیک از داده‌های توییتر آزمایش کردند ( جدول ۶ را ببینید). رویکرد تخمین سرعت مستقیم از نقاط داده به عنوان داده های تله متری با استفاده از فرمول سرعت استفاده می کند. استفاده از آن به طور مستقیم از داده های تله متری و نحوه استفاده از آنها در راه حل های اختصاصی تقلید می کند. اگر بتوان از این رویکرد استفاده کرد، دیگر نیازی به هیچ مدل یادگیری ماشینی در لایه Live Traffic و استفاده از سایر فضاهای ویژگی وجود نخواهد داشت. با این حال، به دلیل فرکانس پایین تولید داده توسط کاربران، این رویکرد برای داده‌های توییتر مناسب نیست – کاربران به ندرت چندین بار در هنگام عبور از یک بخش جاده توییت می‌کنند. مبتنی بر زمینهپروکسی در گذشته به طور گسترده توسط محققان مورد مطالعه قرار گرفته است. با این حال، وابستگی بالای پلت فرم و فقدان عبارات کلیدی استاندارد ترافیک، قابلیت انتقال آن را محدود می کند. استفاده از عبارات و فرهنگ های خاص زبان، تجزیه و تحلیل مبتنی بر زمینه را دست و پا گیر و بسیار پیچیده می کند. در دسترس بودن داده ها برای تجزیه و تحلیل مبتنی بر زمینه نیز کم است زیرا تعداد بسیار کمی از توییت ها حاوی عبارات یا احساسات مرتبط با ترافیک هستند. کاربران تمایل دارند بعد از ترافیک واقعی توییت‌های مرتبط با ترافیک را پست کنند، بنابراین این پراکسی فقط برای زمان‌بندی‌های بزرگ‌تر قابل استفاده است.

۲٫۵٫ پروکسی نقطه بهره برداری از زمین و پوشش زمین

POI استفاده از زمین و پوشش زمین نشان دهنده زیرساخت هایی است که به عنوان یک راه نجات برای هر شهر عمل می کند. آنها از سوپرمارکت‌ها، بیمارستان‌ها، مدارس و دانشگاه‌ها گرفته تا ایستگاه‌های اتوبوس، پارکینگ‌ها، و غیره را در بر می‌گیرند. در SM2T، POI‌های کاربری زمین انتخاب شده به عنوان یک فضای ویژگی اضافی برای پیش‌بینی ترافیک استفاده می‌شوند. نویسندگان وزن ها و شعاع ضربه را اختصاص دادند (ر.ک. [ ۳۸ ]) و از آنها در طول پردازش داده ها برای محاسبه اثرات آنها بر ترافیک بخش های جاده های مجاور استفاده کردند.
چهار رویکرد برای تجمیع یا شمارش POIهای مختلف کاربری زمین در نزدیکی یک بخش جاده آزمایش شده است ( شکل ۳ را ببینید). تجمیع با استفاده از یک شبکه معمولی برای تسلیت انجام شد. ایده این است که از این نقاط داده برای علامت گذاری بخش های جاده ای نزدیک با درجات مختلف ازدحام ترافیک استفاده شود. ساده ترین رویکرد (ر.ک. شکل ۳الف) تمام POIهایی را که در یک کادر محدود وجود دارند، می شمارد. سپس از این شمارش‌ها برای علامت‌گذاری پرچم‌های ترافیکی، بر اساس نوع جاده، برای تمام بخش‌های جاده در داخل جعبه مرزی استفاده شد. با این حال، مشاهده شد که POI های مختلف بر اساس فاصله آنها از بخش های جاده مجاور و تعداد افرادی که به آنها خدمت می کنند، می توانند درجات مختلفی از تأثیر ترافیک را داشته باشند. برای ثبت این، بافرهای جاده و/یا وزن POI نیز به منظور فیلتر کردن و وزن کردن POIها مورد استفاده قرار گرفتند ( شکل ۳ b-d).

۲٫۶٫ پروکسی مرکزیت

در نهایت، یک اندازه‌گیری مرکزیت میانی اقتباس شده از هر بخش جاده به عنوان یک فضای ویژگی اضافی استفاده می‌شود. برای SM2T، نویسندگان معیار اصلی مرکزیت بین بودن [ ۳۹ ] را برای شامل توزیع فضایی تراکم جمعیت و POI ها تطبیق دادند. این مجموعه از POI با POIهای استفاده از زمین و پوشش زمین که برای پراکسی POI در بخش ۲٫۵ استفاده می شود متفاوت است. گائو [ ۴۰] نشان داد که انتخاب نقطه شروع و پایان سفرهای شبیه سازی شده بر اساس تراکم جمعیت و داده های POI، رابطه نزدیک تری بین شاخص مرکزیت و جریان ترافیک واقعی در یک شهر به دست می دهد. بخش‌های اصلی جاده‌ای که اکثریت جمعیت را به زیرساخت‌های حیاتی مانند سوپرمارکت‌ها، بیمارستان‌ها و غیره متصل می‌کنند، می‌توانند شناسایی شوند و متعاقباً به‌عنوان حساس‌تر در برابر ترافیک مشخص شوند. Ohsome API [ ۴۱ ] برای دانلود شبکه جاده های شهر و POI های انتخاب شده استفاده شد. ما مرکزیت را با شبیه سازی ۲۰ هزار سفر در هر شهر، با موضوع و وزن توابع کنش انسانی با استفاده از openrouteservice محاسبه کردیم ( https://openrouteservice.orgقابل دسترسی در ۴ آوریل ۲۰۲۲). سفرها بر اساس جفت مکان‌های نمونه‌برداری شده برای هر شهر شبیه‌سازی شدند. یک مکان بر اساس رویکرد احتمال نمونه گیری ناهموار با استفاده از تراکم جمعیت به عنوان وزن احتمال ترسیم شد. مورد دیگر از POIهای تابع عمل انسانی انتخاب شد. داده‌های جمعیت از لایه جمعیت اسکان انسانی جهانی [ ۴۲ ، ۴۳ ] به دست آمد]، مجموعه داده شطرنجی با اندازه سلول ۲۵۰ متری. POI تابع کنش انسانی شامل POIهایی از گروه‌های عملکردی «کار»، «آموزش»، «خرید» و «تفریح» است. سفرهای کوتاه‌تر از ۱ کیلومتر رد شد زیرا ما سفر ماشینی را فرض می‌کردیم. ما همچنین از یک تابع فاصله-واپاشی برای ایجاد سفرهای کوتاه‌تر از سفرهای طولانی مدت استفاده کردیم. تطبیق مسیرها به شبکه خیابان OSM برای محاسبه مرکزیت با استفاده از تطبیق نقشه سریع توسعه یافته توسط Canfast [ ۴۴ ] انجام شد.

۲٫۷٫ تفکیک مکانی، زمانی و موضوعی

سرعت حرکت وسایل نقلیه در یک بخش جاده – که با سطح تراکم ترافیک نسبت معکوس دارد – همیشه یک عدد صحیح مثبت است. در حالت ایده آل، مشکل اساسی باید به عنوان یک مشکل رگرسیونی در نظر گرفته شود که تمام فضاهای ویژگی و برچسب های هدف دارای اعداد صحیح مثبت هستند. با این حال، تجسم داده های اولیه و تجزیه و تحلیل آماری نشان داد که پیش بینی ترافیک در سطح جاده با وضوح زمانی چند دقیقه به دلیل در دسترس بودن بسیار کم داده های توییتر امکان پذیر نیست. در میان همه متغیرهای مستقل در نظر گرفته شده، داده های رسانه های اجتماعی تنها منبعی بودند که حاوی اطلاعات مهر زمانی بودند. بنابراین، این یک عامل کنترل کننده برای وضوح زمانی برای لایه ترافیک زنده بود ( شکل ۱ را ببینید.). علاوه بر این، تعداد توئیت‌هایی که با نقشه مطابقت داده شده با یک بخش جاده معین برای استخراج هر گونه پراکسی آماری معنی‌داری در مقیاس بخش‌های جاده برای تحلیل رگرسیون کافی نبود. بنابراین، نویسندگان مجبور به کاهش وضوح مکانی، زمانی و موضوعی برای پیش‌بینی‌های معنادار شدند. در مورد وضوح فضایی، چهار اندازه کاشی، یعنی ۵۰، ۱۰۰، ۵۰۰ و ۱۰۰۰ متر، برای شناسایی یک سازش خوب بین وضوح و دقت پیش‌بینی بررسی شد. در مورد وضوح زمانی، در ابتدا، سطل‌های زمان ثابت که نشان‌دهنده ساعات رفت‌وآمد اداری هستند (۰۷:۰۰-۱۰:۰۰ و ۱۵:۰۰-۱۹:۰۰) بازرسی شدند. با این حال، به دلیل تعداد کم نقاط داده در هر سطل زمانی، تغییرات زمانی ترافیک در مدل در نظر گرفته نشد. بجای،
برای کاهش وضوح موضوعی، با استفاده از سه کلاس تراکم ترافیک به عنوان خروجی نهایی، مشکل به یک مشکل طبقه بندی تبدیل شد: تراکم ترافیک بالا (HTC)، تراکم ترافیک متوسط ​​(MTC) و ازدحام ترافیک کم (LTC). تعریف سه کلاس تراکم برای یک اندازه کاشی معین مبتنی بر رویکرد سطل کمیت برابر با در نظر گرفتن توییت‌ها، POIهای پوشش زمین کاربری زمین و شاخص‌های مرکزیت بین‌المللی است. ۳۳٪ بالا نشان دهنده HTC، ۳۳٪ پایین LTC و وسط ۳۳٪ MTC است. بنابراین، نویسندگان توانستند همه انواع بزرگراه OSM را ترکیب کنند، برخلاف رگرسیون، که در آن هر نوع بزرگراه باید به طور جداگانه مورد بررسی قرار می گرفت. این منجر به تعداد بیشتری از نمونه های آموزشی شد.
در نهایت، داده‌های Uber Movement به عنوان برچسب هدف برای آموزش مدل استفاده شد. سطل‌های سرعت ثابت (به جدول ۴ مراجعه کنید ) برای تبدیل داده‌های Uber پیوسته به کلاس‌های ترافیک برای هر نوع بزرگراه OSM (بزرگراه، تنه، اولیه، ثانویه، سوم و مسکونی) استفاده شد.

۲٫۸٫ مدیریت داده ها از دست رفته است

پس از پردازش داده‌ها، مجموعه داده دارای چندین کاشی (برای هر اندازه کاشی) به همراه برچسب‌های کلاس HTC در مقابل بدون HTC برای Uber، Twitter، POIهای پوشش زمین کاربری زمین و مرکزیت بین‌المللی بود. از آنجایی که کاشی‌های زیادی وجود داشت که حداقل یکی از مقادیر در آنها وجود نداشت، نویسندگان سه مجموعه داده جداگانه برای آموزش مدل آماده کردند. در اولین مجموعه داده، فقط آن کاشی‌هایی گرفته شد که تمام مقادیر غیر تهی برای ستون‌های مختلف وجود داشت. این مجموعه داده از نظر تعداد ردیف ها کوچکترین بود. در مجموعه داده دوم، همه آن کاشی‌ها در جایی گرفته شدند که ستون توییتر دارای یک مقدار غیر تهی بود. در مورد مواردی که POIهای پوشش زمین استفاده از زمین و/یا کلاس مرکزیت میانی وجود نداشت، از برچسب no-HTC (ساختگی) استفاده شد. در نهایت، در مجموعه داده سوم، تمام کاشی‌ها برداشته شدند و تمام سلول‌های خالی با برچسب بدون HTC (ساختگی) جایگزین شدند. دلیل استفاده از برچسب no-HTC به عنوان ساختگی در اینجا این فرض بود که داده ها ممکن است به درستی عدم وجود هر گونه توییت را نشان دهند، در نتیجه نشان دهنده ازدحام کم ترافیک و در نتیجه عدم وجود HTC است. برای تمام آموزش های بعدی، این سه مجموعه داده به طور مستقل مورد تجزیه و تحلیل قرار گرفتند.

۲٫۹٫ مقایسه روش های یادگیری ماشین

برای یافتن بهترین الگوریتم طبقه‌بندی مناسب برای رگرسیون لجستیک [ ۴۵ ]، Naive Bayes [ ۴۵ ]، طبقه‌بندی‌کننده k-نزدیک‌ترین همسایه [ ۴۶ ]، مدل‌های جنگل تصادفی [ ۴۷ ] و مدل‌های ماشین برداری پشتیبان [ ۴۸ ] با استفاده از CV جستجوی شبکه‌ای مقایسه شدند. رویکرد در بسته پایتون Sklearn [ ۴۹ ] برای تنظیم هایپرپارامتر. اگرچه بسیاری از مدل‌های دیگر را می‌توان آزمایش کرد، اما این مدل‌های انتخاب شده استانداردترین مدل‌هایی هستند که پیاده‌سازی آسان و همچنین سبک وزن هستند. دقت (ر.ک. معادله ( ۱ )) برای ارزیابی مدل مورد استفاده قرار گرفت، زیرا این بالاترین اولویت برای پروژه بود – فراخوانی یا امتیاز F1 استفاده نشد.

دقت، درستی=TPTP+FP

با TP مثبت واقعی و FP مثبت کاذب.

واحد فضایی که در آن مدل‌سازی صورت گرفت، سطح کاشی‌ها بود.

۳٫ نتایج

هنگام مقایسه پیش بینی انجام شده توسط کلاس مرکزیت به عنوان پیش بینی کننده برای اندازه های مختلف کاشی و سه سطل سرعت (HTC، MTC و LTC)، کلاس HTC بالاترین دقت را نشان داد ( شکل ۴ ). مقایسه اندازه‌های مختلف کاشی نشان داد که رابطه بین متغیر پیش‌بینی‌کننده و هدف در اندازه‌های کاشی ۱۰۰ و ۵۰ متر قوی‌ترین است ( شکل ۴ ). نتیجه‌گیری‌های مشابهی برای پراکسی‌های توییتر و پیش‌بینی‌کننده‌های POI پوشش زمین استفاده از زمین پشتیبانی شد (نتایج نشان داده نشد). از آنجایی که بهترین پیش‌بینی هنگام پیش‌بینی تنها HTC به دست آمد، مشکل طبقه‌بندی چند کلاسه متعاقباً به یک طبقه‌بندی بولی تبدیل شد که در آن HTC در مقابل no-HTC ارزیابی و پیش‌بینی شد.
پیش‌بینی‌های مبتنی بر دو پراکسی ( تعداد کاربر در یک بخش جاده و تعداد کاربر در مجاورت ) بهتر از استفاده از شمارش ساده توییت برای موقعیت‌های تراکم ترافیک بالا بود ( شکل ۵ را ببینید). نتیجه مشابهی برای تجمع POIهای پوشش زمین کاربری زمین با استفاده از وزن و شعاع روش ضربه پیدا شد.
در حالی که پیش‌بینی تراکم ترافیک بالا برای ترکیب همه شهرها تقریباً متعادل بود، پیش‌بینی‌ها برای شهرهای جداگانه نامتعادل بود ( شکل ۶ و شکل ۷ را ببینید.). سینسیناتی تقریباً به طور کامل بدون برچسب HTC و سائوپائولو تقریباً به طور کامل برچسب HTC برای اندازه کاشی های ۵۰۰ و ۱۰۰ متری داشت. از سوی دیگر، کیف توزیع متعادل تری از مکان های کاشی HTC و بدون HTC را در ۱۰۰۰ متر و همچنین در اندازه کاشی ۵۰۰ متر نشان داد. جالب است بدانید شهرهایی که ازدحام ترافیک بیشتری را نشان می‌دهند در صورتی که داده‌های اوبر دقت پیش‌بینی بالاتری داشتند. بنابراین، یک رویکرد واقع بینانه تر، در نظر گرفتن تمام کاشی های شهرهای مختلف برای از بین بردن تأثیر شدید این عدم تعادل است، اگرچه همه شهرها نیز به طور مستقل برای آموزش بازرسی شدند.
سپس، با مقایسه پنج مدل مختلف یادگیری ماشینی از نظر دقت در همه شهرها، طبقه‌بندی‌کننده k نزدیک‌ترین همسایه‌ها بهترین عملکرد را از نظر میانگین دقت برای همه اندازه‌های کاشی داشت ( شکل ۸ را ببینید). با این حال، تفاوت عملکرد در بین مدل‌های مختلف، به‌ویژه بین k-نزدیک‌ترین همسایگان و طبقه‌بندی Random Forest بسیار ناچیز بود. با این حال، به دلیل پیچیدگی مدل کمتر، اولی را برای تحلیل بیشتر انتخاب کردیم. اگر مدل باید به عنوان بخشی از یک وب سرویس استفاده شود، مفید است، زیرا مدل های سبک وزن از پیش بینی سریع و تنظیم مجدد هایپرپارامتر پشتیبانی می کنند. در مطالعه‌ای بر روی پیش‌بینی تراکم ترافیک با استفاده از مجموعه‌ای از پیش‌بینی‌کننده‌ها، تیم Uber همچنین طبقه‌بندی‌کننده k-نزدیک‌ترین همسایه و همچنین بهترین مدل را شناسایی کرد.۵۰ ]. در میان اندازه‌های مختلف کاشی، ۱۰۰ و ۵۰ متر بالاترین میانگین دقت را ارائه می‌دهند. در تمام مدل‌ها، اگر کاشی‌های دارای اطلاعات ویژگی‌های گمشده به جای استفاده از یک مقدار ساختگی برای آن کاشی‌ها حذف شوند، میانگین دقت بالاترین بود.
هیپرتنینگ طبقه‌بندی‌کننده k-نزدیک‌ترین همسایه تعداد بهینه ۳۰ همسایه را برای اندازه‌های کاشی ۵۰، ۱۰۰ و ۵۰۰ متری پیشنهاد می‌کند ( شکل ۹ را ببینید). برای اندازه کاشی ۱۰۰۰ متری، هیچ ارزش واضحی قابل شناسایی نیست. این به دلیل تعداد بسیار کم نمونه‌ها برای چنین وضوح فضایی درشتی است که منجر به تعداد بسیار کمی همسایه‌ها می‌شود، بنابراین اجازه بهینه‌سازی مناسب پارامتر را نمی‌دهد.
شکل ۷٫ تجسم کلاس‌های تراکم ترافیک مشتق شده از تمام فضاهای ویژگی با استفاده از یک رویکرد کمی و مجموعه داده اعتبار (Uber) برای سه شهر (هر دو سناریو مورد لبه را نشان می‌دهد). تعداد سلول‌های دارای پیش‌بینی متفاوت است، زیرا پیش‌بینی‌کننده‌ها برای همه کاشی‌ها در دسترس نبودند. دقت پیش بینی های مدل در شکل ۱۰ ارائه شده است .
شکل ۸٫ مقایسه دقت پنج الگوریتم طبقه بندی برای اندازه های مختلف کاشی. این سه نمودار مجموعه داده‌های مختلف را بر اساس نحوه مدیریت سلول‌های خالی با استفاده از مقدار ساختگی نشان می‌دهند. تنوع در نمودارهای جعبه به دلیل دقت متفاوت برای هر شهر است.
شکل ۹٫ انتخاب بهترین عملکرد تعداد همسایه طبقه بندی کننده k نزدیکترین همسایه برای اندازه های مختلف کاشی. منحنی قرمز نشان دهنده شهرهای ترکیبی است. رنگ های مشکی مختلف نشان دهنده هر شهر است. خط آبی عمودی مقدار انتخاب شده ۳۰ نزدیکترین همسایه را مشخص می کند.
شکل ۱۰٫ عملکرد طبقه بندی کننده k نزدیکترین همسایه (k = 30) برای اندازه های مختلف کاشی، شهرهای مختلف و مجموعه داده های ترکیبی. برای هر شهر، مدل با استفاده از یک رویکرد اعتبار سنجی متقابل ۵ برابری با استفاده از همه شهرها به جز شهر انتخاب شده آموزش داده شد و در برابر دومی اعتبار سنجی شد. برای مجموعه داده ترکیبی، مدل با استفاده از رویکرد اعتبارسنجی متقابل ۵ برابری و با دقت برای کل مجموعه داده محاسبه شد.
برای اندازه‌های کاشی ۱۰۰ و ۵۰ متری، طبقه‌بندی‌کننده k نزدیک‌ترین همسایه با ۳۰ همسایه بیش از ۶۰ درصد دقت را برای هر شهر به دست آورد ( شکل ۱۰ را ببینید). برای مجموعه داده ترکیبی، دقت بالای ۸۰ درصد برای این دو اندازه کاشی بود. اگرچه دقت بالا بود، اما می توان انتظار داشت که بین ۷۰% و ۸۰% باشد زیرا عدم تعادل کلاس برای مجموعه داده ترکیبی هنوز در یک دال نسبتاً نامتعادل است ( شکل ۶ را ببینید.). در سطح شهر، دقت به طور مثبت با تعداد کاربران توییتر (Pearson’s r: 0.41) و با تعداد توییت ها (Pearson’s r: 0.37) مرتبط بود – انتظار می رفت تعداد توییت ها و کاربران توییتر در هر شهر همبستگی بالایی داشته باشند (Pearson’s r: 0.94). علاوه بر این، شهرهایی با عدم تعادل طبقاتی بالاتر با دقت بالاتری همراه بودند (Pearson’s r: 0.47).

۴٫ بحث و محدودیت

در دسترس بودن محدود توییت های جغرافیایی یک چالش بزرگ برای پیش بینی سرعت ترافیک یا تراکم ترافیک بود. بنابراین، مجبور شدیم مدل را ساده کنیم و بر پروکسی ها تکیه کنیم. مدل کاهش‌یافته اطلاعات کمتری نسبت به آنچه در ابتدا در نظر گرفته شده بود ارائه می‌کند، زیرا فقط می‌تواند بین HTC و no-HTC تمایز قائل شود. این ممکن است هنگام مقایسه این رویکرد با رویکردهای تجاری ناامید کننده باشد. با این وجود، رویکرد ما مهم‌ترین حالت‌ها را به تصویر می‌کشد: گیر کردن در ترافیک یا حرکت. این اطلاعات مهمی را برای مسیریابی فراهم می‌کند، زیرا موقعیت‌های HTC پیامدهای جدی در زمان سفر دارند و بر سطح استرس رانندگان تأثیر زیادی می‌گذارند [ ۵۱ ]]. توییتر خدمات فراداده مختصات GNSS خود را در سال ۲۰۱۹ متوقف کرد. بنابراین، در دسترس بودن توییت بعید است بهبود یابد. با این حال، رویکرد مبتنی بر پروکسی می‌تواند به راحتی برای ترکیب سایر داده‌های رسانه‌های اجتماعی با برچسب جغرافیایی در دسترس عموم تطبیق داده شود. گسترش پروکسی ها در این رابطه احتمالاً کیفیت پیش بینی را بهبود می بخشد.
مدل ها برای دقت تنظیم شده بودند. دقت ۸۱ درصد از طبقه‌بندی‌کننده k-نزدیک‌ترین همسایه برای مجموعه داده ترکیبی در اندازه کاشی ۱۰۰ متر نشان‌دهنده عملکرد خوب مدل است. با این حال، از آنجایی که فراخوان در طول انتخاب مدل در نظر گرفته نشد، پیش‌بینی مدل ممکن است خیلی محافظه‌کار باشد و بخش‌های جاده‌ای را که از ازدحام رنج نمی‌برند به‌عنوان پر ترافیک طبقه‌بندی کند. بنابراین، پیشنهادهای مسیریابی با در نظر گرفتن پیش‌بینی مدل احتمالاً محافظه‌کارانه هستند.
از آنجایی که پیش‌بینی تراکم ترافیک در سطح کاشی‌ها انجام می‌شود، استفاده از پیش‌بینی در مسیریابی عدم قطعیت بیشتری را اضافه می‌کند زیرا ازدحام بر تمام بخش‌های جاده‌ای که با کاشی تقاطع می‌کنند تأثیر می‌گذارد. ازدحام ترافیک در بزرگراه ممکن است بر ازدحام ترافیک در یک جاده مسکونی مجاور تأثیری نداشته باشد. با این حال، در بسیاری از موقعیت‌ها این احتمال وجود دارد که ازدحام ترافیک به یک بخش جاده محدود نمی‌شود، بلکه بر بخش‌های جاده متصل نیز تأثیر می‌گذارد.
به دلیل عدم پوشش داده‌های Uber، شهرهای آسیایی و آفریقایی به شدت در مجموعه داده‌های مطالعه موردی ما نشان داده نشده بودند. تنها یک شهر، نایروبی، از این دو قاره در دسترس بود. این نگرانی‌ها را در مورد انتقال مدل به شهرهای آسیایی یا آفریقایی ایجاد می‌کند که با کیفیت داده‌های OSM ضعیف‌تر و اطلاعات تراکم جمعیت کمتر مشخص می‌شوند. برای چند شهر آفریقایی یا آسیایی، مجموعه داده های مدیریتی یا عمومی ممکن است در دسترس باشد که می تواند به جای مجموعه داده Uber استفاده شود. با این حال، از آنجایی که این داده ها بدون ارجاع به اشیاء OSM ارائه می شوند، استفاده از این داده ها شامل تطبیق نقشه بین داده ها و شبکه جاده OSM است. این خارج از محدوده تحلیل فعلی بود، اما باید در مطالعات آینده انجام شود.
برای انتقال مدل به سایر شهرها نیاز به محاسبه پروکسی مرکزیت برای آنها نیز خواهد بود. اگر رویکرد به یک منطقه بزرگتر مانند شهرهای ایالات متحده یا هند منتقل شود، رویکرد مبتنی بر شبیه‌سازی ممکن است از نظر محاسباتی نیاز داشته باشد. کامل بودن کافی شبکه جاده‌ای پیش‌نیاز این رویکرد است – در حالی که بیشتر شهرها نسبتاً خوب نقشه‌برداری شده‌اند [ ۵۲ ]، هنوز شهرهایی وجود دارند که کامل بودن آنها ممکن است یک مسئله باشد. با این حال، جاده‌های با اهمیت بالاتر معمولاً نقشه‌برداری بسیار کامل‌تری دارند، بنابراین ممکن است این یک مشکل واقعی نباشد.
علاوه بر این، استفاده از رسانه های اجتماعی بین کشورها متفاوت است. تفاوت ها بر تعداد کل کاربران رسانه های اجتماعی، پلت فرم رسانه های اجتماعی و سهم توییت های جغرافیایی قبل از سال ۲۰۱۹ تأثیر می گذارد [ ۵۳ ]. این بر قابلیت انتقال تأثیر می گذارد و تعداد پست های جغرافیایی ارجاع داده شده باید به اندازه کافی زیاد باشد. تعداد کاربران توییتر و توییت‌های جغرافیایی در شهرهایی که به عنوان مطالعه موردی ما استفاده می‌شوند، متفاوت است ( جدول ۳ را ببینید.). عملکرد مدل ارتباط مثبتی با این اعداد، به ویژه برای اندازه‌های کاشی کوچکتر نشان داد. از این رو، انتقال این رویکرد احتمالاً فقط برای شهرهایی با سطح کافی از فعالیت رسانه‌های اجتماعی مرجع جغرافیایی امیدوارکننده است. برای شهرهایی با حداقل فراوانی پست‌های رسانه‌های اجتماعی جغرافیایی مشابه کیف (کمترین تعداد کاربران توییتر و توییت‌ها در سایت‌های مطالعه موردی ما)، این رویکرد ممکن است قابل اجرا باشد. با این حال، این نیاز به آزمایش بیشتری دارد.
برای طبقه بندی مجموعه داده Uber به برچسب های HTC و no-HTC، از تعاریف کلاس ایستا ( جدول ۴ ) استفاده شد. در حالی که این برای یک رویکرد قابل انتقال در مقیاس جهانی ضروری بود، از نظر ذهنی بودن معانی طبقاتی منجر به محدودیت‌هایی شد. محدودیت سرعت ترافیک بالا، متوسط ​​یا کم یک اصطلاح ذهنی است که در درجه اول به کشور، نوع جاده و دیدگاه مسافر بستگی دارد. بنابراین، یک رویکرد کاربردی تر، تعریف یک فرهنگ لغت جهانی از تعاریف طبقاتی است که باید برای هر شهر یا کشور استفاده شود. با این حال، تا آنجا که نویسندگان اطلاعات دارند، این امر تاکنون توسط سایر مطالعات انجام نشده است و بررسی بیشتر در این راستا خارج از محدوده مطالعه حاضر بود.
شهرهای منفرد از نظر میزان تراکم ترافیک به شدت متفاوت بودند. در حالی که این منعکس کننده طیف موقعیت های ترافیکی در سراسر شهرها است، ممکن است بر کیفیت مدل و قابلیت انتقال به شهرهای دیگر تأثیر بگذارد. در حالی که کل مجموعه داده نسبتاً متعادل به نظر می رسد، شهرهای جداگانه برچسب های بیشتر یا کمتری را برای HTC به کلاس بدون HTC ارائه می دهند. بنابراین، ویژگی‌های موارد شدید سائوپائولو و سینسیناتی ممکن است تأثیر زیادی بر آنچه مدل برای همه شهرها به عنوان ویژگی‌های مهم برای پیش‌بینی بدون HTC و HTC آموخته باشد. مطالعات بیشتر در این زمینه ضروری به نظر می رسد.
چالش دیگر برای تحقیقات آینده، عادی سازی فضاهای ویژگی در سراسر شهرها است. رویکرد صدک فعلی صرفاً مبتنی بر داده است و احتمالاً قابل انتقال به شهرهای خارج از مطالعه موردی نیست. این ممکن است منجر به شکاف مصنوعی بین کاشی هایی با شرایط ترافیکی مشابه شود.

۵٫ نتیجه گیری و کار آینده

برآورد اطلاعات ترافیک از داده های رسانه های اجتماعی به وضوح چالش برانگیز است. در دسترس بودن داده ها به عنوان یک مانع بزرگ در این زمینه نشان داده شده است. با این حال، ما نشان داده‌ایم که هنگام ترکیب اطلاعات پراکسی مشتق شده از توییتر با اقدامات بین شبکه سازگار و اطلاعات POI استفاده از زمین و پوشش زمین، می‌توان تراکم ترافیک بالا را پیش‌بینی کرد. ما یک روش معقول برای استفاده از این پروکسی ها برای شهرها در مطالعات موردی نشان داده ایم. مطالعه ما بسیاری از چالش‌هایی را که باید مورد توجه قرار گیرند برجسته می‌کند و راهنمایی‌هایی در مورد مصالحه‌های معقول ارائه می‌کند.
پیش‌بینی تراکم ترافیک بالا در سطح کاشی ۱۰۰ متر بر اساس رویکرد ارائه‌شده از طریق یک سرویس وب در دسترس است ( شکل A1 ، SM2T https://sm2t.heigit.org در ۱۰ سپتامبر ۲۰۲۲ مشاهده شده است). این سرویس دارای چندین ماژول از نظر استقرار API، آموزش مدل و تنظیم هایپرپارامتر است که به اشتراک گذاری نتایج بر روی نقشه وب و ادغام با سرویس های شخص ثالث مانند OpenRouteService امکان پذیر است. در کار آینده، نویسندگان امکان‌سنجی استفاده از مدل فعلی در کشورهای آسیایی و آفریقایی را با آزمایش سایر منابع رسانه‌های اجتماعی و مجموعه داده‌های سرعت در دسترس عموم به عنوان حقیقت اصلی بررسی خواهند کرد.

اختصارات

در این نسخه از اختصارات زیر استفاده شده است:

AADT میانگین ترافیک روزانه سالانه
API رابط برنامه نویسی کاربردی
GNSS سیستم جهانی ناوبری ماهواره ای
جی پی اس سیستم موقعیت یاب جهانی
HTC تراکم ترافیک بالا
HTTP پروتکل انتقال ابر متن
LTC ازدحام کم ترافیک
ML فراگیری ماشین
MTC تراکم ترافیک متوسط
NLP پردازش زبان طبیعی
OD مقصد اصلی
OSM OpenStreetMap
POI نقطه مورد علاقه
SDK بسته توسعه نرم افزار
SM2T Social Media2 Traffic
VGI اطلاعات جغرافیایی داوطلبانه

پیوست A. معماری و رابط SM2T

شکل A1. معماری و رابط SM2T.

منابع

  1. آحاس، ر. آسا، ا. سیلم، اس. Tiru، M. ریتم های روزانه حرکات مسافران حومه شهر در منطقه شهری تالین: مطالعه موردی با داده های موقعیت یابی موبایل. ترانسپ Res. قسمت ظهور. تکنولوژی ۲۰۱۰ ، ۱۸ ، ۴۵-۵۴٫ [ Google Scholar ] [ CrossRef ]
  2. کانگ، سی. ما، ایکس. تانگ، دی. لیو، ی. الگوهای تحرک انسانی درون شهری: دیدگاه مورفولوژی شهری. فیزیک یک آمار مکانیک. Appl. ۲۰۱۲ ، ۳۹۱ ، ۱۷۰۲-۱۷۱۷٫ [ Google Scholar ] [ CrossRef ]
  3. Bar-Gera، H. ارزیابی یک سیستم مبتنی بر تلفن همراه برای اندازه گیری سرعت ترافیک و زمان سفر: مطالعه موردی از اسرائیل. ترانسپ Res. قسمت C Emerg. تکنولوژی ۲۰۰۷ ، ۱۵ ، ۳۸۰-۳۹۱٫ [ Google Scholar ] [ CrossRef ]
  4. دی فابریتیس، سی. راگونا، آر. Valenti، G. برآورد و پیش‌بینی ترافیک بر اساس داده‌های شناور خودرو در زمان واقعی. در مجموعه مقالات یازدهمین کنفرانس بین المللی IEEE در سال ۲۰۰۸ در مورد سیستم های حمل و نقل هوشمند، پکن، چین، ۱۲ تا ۱۵ اکتبر ۲۰۰۸٫ IEEE: Piscataway, NJ, USA, 2008; ص ۱۹۷-۲۰۳٫ [ Google Scholar ]
  5. هررا، جی سی. کار، DB; شاه ماهی، آر. Ban، XJ; جیکوبسون، کیو. Bayen، AM ارزیابی داده های ترافیکی به دست آمده از طریق تلفن های همراه مجهز به GPS: آزمایش میدانی قرن موبایل. ترانسپ Res. قسمت C Emerg. تکنولوژی ۲۰۱۰ ، ۱۸ ، ۵۶۸-۵۸۳٫ [ Google Scholar ] [ CrossRef ]
  6. استایگر، ای. دی آلبوکرک، جی پی; Zipf، A. مروری بر ادبیات سیستماتیک پیشرفته در تجزیه و تحلیل فضایی-زمانی داده های t witter. ترانس. GIS ۲۰۱۵ ، ۱۹ ، ۸۰۹-۸۳۴٫ [ Google Scholar ] [ CrossRef ]
  7. هوانگ، دبلیو. خو، اس. یان، ی. Zipf، A. کاوشی در مورد تعامل بین فعالیت های انسانی شهری و شرایط ترافیک روزانه: مطالعه موردی تورنتو، کانادا. شهرها ۲۰۱۹ ، ۸۴ ، ۸–۲۲٫ [ Google Scholar ] [ CrossRef ]
  8. هو، ی. Wang, RQ درک حذف برچسب‌گذاری جغرافیایی دقیق در توییت‌ها. نات. هوم رفتار ۲۰۲۰ ، ۴ ، ۱۲۱۹-۱۲۲۱٫ [ Google Scholar ] [ CrossRef ]
  9. یائو، دبلیو. کیان، اس. از توییتر تا پیش‌بینی‌کننده ترافیک: پیش‌بینی ترافیک صبح روز بعد با استفاده از داده‌های رسانه‌های اجتماعی. ترانسپ Res. قسمت C Emerg. تکنولوژی ۲۰۲۱ ، ۱۲۴ ، ۱۰۲۹۳۸٫ [ Google Scholar ] [ CrossRef ]
  10. یو، HF; لو، HY; هسیه، اچ پی; لو، جی کی. مک کنزی، تی جی; چو، جی دبلیو. چانگ، PH; هو، CH; چانگ، CF; وی، YH; و همکاران گروه مهندسی ویژه و طبقه‌بندی کننده برای جام KDD 2010. موجود به صورت آنلاین: https://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.367.249&rep=rep1&type=pdf (در ۲۶ ژوئن ۲۰۲۲ قابل دسترسی است).
  11. ویس، دی. نلسون، ا. بارگاس-روئیز، سی. گلیگوریچ، ک. بوادکار، س. گابریلوویچ، ای. برتوزی-ویلا، آ. روزیر، جی. گیبسون، اچ. شیکل، تی. و همکاران نقشه های جهانی زمان سفر به مراکز درمانی نات. پزشکی ۲۰۲۰ ، ۲۶ ، ۱۸۳۵-۱۸۳۸٫ [ Google Scholar ] [ CrossRef ]
  12. کلر، اس. گابریل، ر. Guth، J. چارچوب یادگیری ماشین برای تخمین سرعت متوسط ​​در شبکه های جاده ای روستایی با داده های نقشه خیابان باز. ISPRS Int. J. Geo-Inf. ۲۰۲۰ ، ۹ ، ۶۳۸٫ [ Google Scholar ] [ CrossRef ]
  13. پاولیوک، دی. کاراتسولی، م. ناتانیل، ای. بررسی پتانسیل محتوای رسانه های اجتماعی برای شناسایی فعالیت های مرتبط با حمل و نقل. در مجموعه مقالات کنفرانس بین المللی قابلیت اطمینان و آمار در حمل و نقل و ارتباطات، ریگا، لتونی، ۱۷-۲۰ اکتبر ۲۰۱۸؛ Springer: برلین/هایدلبرگ، آلمان، ۲۰۱۸; صص ۱۳۸-۱۴۹٫ [ Google Scholar ]
  14. کافی، سی. پوزدنوخوف، الف. تجزیه زمانی و غنی سازی معنایی جریان های تحرک. در مجموعه مقالات ششمین کارگاه بین المللی ACM SIGSPATIAL درباره شبکه های اجتماعی مبتنی بر مکان، اورلاندو، فلوریدا، ایالات متحده آمریکا، ۵ نوامبر ۲۰۱۳٫ صص ۳۴-۴۳٫ [ Google Scholar ]
  15. لی، جی اچ. گائو، اس. گولیاس، KG مقایسه ماتریس های مبدا-مقصد از مدل تقاضای سفر و داده های رسانه های اجتماعی. در مجموعه مقالات نود و پنجمین نشست سالانه هیئت تحقیقات حمل و نقل، واشنگتن دی سی، ایالات متحده آمریکا، ۱۰ تا ۱۴ ژانویه ۲۰۱۶٫ [ Google Scholar ]
  16. یانگ، اف. جین، پی جی؛ وان، ایکس. لی، آر. Ran، B. برآورد تقاضای سفر مبدأ-مقصد پویا با استفاده از داده های شبکه اجتماعی مبتنی بر مکان. در مجموعه مقالات نود و سومین نشست سالانه هیئت تحقیقات حمل و نقل، واشنگتن دی سی، ایالات متحده آمریکا، ۱۲ تا ۱۶ ژانویه ۲۰۱۴٫ [ Google Scholar ]
  17. Fonte, CC; مینگینی، ام. پاتریارکا، جی. آنتونیو، وی. ببینید، L. Skopeliti، A. ایجاد نقشه های کاربری زمین و پوشش زمین به روز و دقیق با استفاده از OpenStreetMap و GlobeLand30. ISPRS Int. J. Geo-Inf. ۲۰۱۷ ، ۶ ، ۱۲۵٫ [ Google Scholar ] [ CrossRef ]
  18. ژائو، اس. ژائو، پی. Cui، Y. چارچوب اندازه گیری مرکزیت شبکه برای تجزیه و تحلیل جریان ترافیک شهری: مطالعه موردی ووهان، چین. فیزیک یک آمار مکانیک. Appl. ۲۰۱۷ ، ۴۷۸ ، ۱۴۳-۱۵۷٫ [ Google Scholar ] [ CrossRef ]
  19. استایگر، ای. رسچ، بی. د آلبوکرک، JP; Zipf، A. استخراج و مرتبط کردن رویدادهای ترافیکی از مشاهدات حسگر انسانی با داده های حمل و نقل رسمی با استفاده از نقشه های خودسازماندهی. ترانسپ Res. قسمت C Emerg. تکنولوژی ۲۰۱۶ ، ۷۳ ، ۹۱-۱۰۴٫ [ Google Scholar ] [ CrossRef ]
  20. گائو، اس. یانگ، جی. یان، بی. هو، ی. یانوویچ، ک. مک‌کنزی، جی. تشخیص جریان‌های تحرک مبدا-مقصد از توییت‌های دارای برچسب جغرافیایی در منطقه بزرگ لس آنجلس. در مجموعه مقالات هشتمین کنفرانس بین المللی علم اطلاعات جغرافیایی، وین، اتریش، ۲۴-۲۶ سپتامبر ۲۰۱۴; صص ۱-۴٫ [ Google Scholar ]
  21. Pun, L. ژائو، پی. لیو، ایکس. یک رویکرد رگرسیون چندگانه برای تخمین جریان ترافیک. دسترسی IEEE ۲۰۱۹ ، ۷ ، ۳۵۹۹۸–۳۶۰۰۹٫ [ Google Scholar ] [ CrossRef ]
  22. Giles، JR; زو ارباخ-شونبرگ، ای. تاتم، ای جی; گاردنر، ال. Bjørnstad، ON; متکالف، سی. Wesolowski، A. مدت سفر بر پویایی فضایی بیماری های عفونی تأثیر می گذارد. Proc. Natl. آکادمی علمی ایالات متحده آمریکا ۲۰۲۰ ، ۱۱۷ ، ۲۲۵۷۲–۲۲۵۷۹٫ [ Google Scholar ] [ CrossRef ]
  23. کای، ال. یانوویچ، ک. مای، جی. یان، بی. Zhu, R. Traffic transformer: گرفتن تداوم و تناوب سری های زمانی برای پیش بینی ترافیک. ترانس. GIS ۲۰۲۰ ، ۲۴ ، ۷۳۶-۷۵۵٫ [ Google Scholar ] [ CrossRef ]
  24. گوث، جی. وورستورن، اس. Keller, S. تخمین چند پارامتری میانگین سرعت در شبکه های جاده ای با استفاده از کنترل فازی. ISPRS Int. J. Geo-Inf. ۲۰۲۰ ، ۹ ، ۵۵٫ [ Google Scholar ] [ CrossRef ]
  25. ژانگ، ی. چنگ، تی. رن، ی. Xie, K. یک مدل جدید یادگیری عمیق پیچش گراف باقیمانده برای پیش‌بینی ترافیک کوتاه‌مدت مبتنی بر شبکه. بین المللی جی. جئوگر. Inf. علمی ۲۰۲۰ ، ۳۴ ، ۹۶۹-۹۹۵٫ [ Google Scholar ] [ CrossRef ]
  26. لیو، ایکس. هوانگ، Q. گائو، اس. Xia, J. کشف دانش فعالیت: شناسایی فعالیت‌های جمعی و فردی با ردپای دیجیتال و داده‌های جغرافیایی منبع باز. محاسبه کنید. محیط زیست سیستم شهری ۲۰۲۱ ، ۸۵ ، ۱۰۱۵۵۱٫ [ Google Scholar ] [ CrossRef ]
  27. وانگ، ی. کائو، جی. لی، دبلیو. گو، تی. Shi, W. بررسی همبستگی تراکم ترافیک از منابع داده های متعدد. اوباش فراگیر. محاسبه کنید. ۲۰۱۷ ، ۴۱ ، ۴۷۰-۴۸۳٫ [ Google Scholar ] [ CrossRef ]
  28. جایاسینگه، ا. سانو، ک. Nishiuchi، H. توضیح الگوهای جریان ترافیک با استفاده از معیارهای مرکزیت. بین المللی J. Traffic Transp. مهندس ۲۰۱۵ ، ۵ ، ۱۳۴-۱۴۹٫ [ Google Scholar ] [ CrossRef ]
  29. ژانگ، تی. سان، ال. یائو، ال. Rong, J. تحلیل تأثیر کاربری زمین بر تراکم ترافیک با استفاده از ترافیک بلادرنگ و POI. J. Adv. ترانسپ ۲۰۱۷ ، ۲۰۱۷ ، ۷۱۶۴۷۹۰٫ [ Google Scholar ] [ CrossRef ]
  30. نیس، پ. Zipf، A. Openrouteservice. org سه بار “باز” ​​است: ترکیب OpenSource، OpenLS و OpenStreetMaps . GIS Research UK (GISRUK 08): منچستر، انگلستان، ۲۰۰۸٫ [ Google Scholar ]
  31. رن، ی. چن، اچ. هان، ی. چنگ، تی. ژانگ، ی. چن، جی. یک مدل یادگیری عمیق ترکیبی یکپارچه برای پیش‌بینی حجم‌های جریان مکانی-زمانی در سطح شهر. بین المللی جی. جئوگر. Inf. علمی ۲۰۲۰ ، ۳۴ ، ۸۰۲-۸۲۳٫ [ Google Scholar ] [ CrossRef ]
  32. لی، جی اچ. گائو، اس. گولیاس، KG آیا می توان از داده های توییتر برای اعتبارسنجی مدل های تقاضای سفر استفاده کرد. در مجموعه مقالات چهاردهمین کنفرانس بین المللی تحقیقات رفتار سفر، ویندزور، بریتانیا، ۱۹ تا ۲۳ ژوئیه ۲۰۱۵٫ [ Google Scholar ]
  33. چنگ، ز. ژیان، اس. رشیدی، ط. مغربی، م. والر، ST ادغام بررسی سفرهای خانگی و داده های رسانه های اجتماعی برای بهبود کیفیت ماتریس od: یک مطالعه موردی مقایسه ای. IEEE Trans. هوشمند ترانسپ سیستم ۲۰۲۰ ، ۲۱ ، ۲۶۲۸–۲۶۳۶٫ [ Google Scholar ] [ CrossRef ]
  34. یانگ، اف. جین، پی جی؛ چنگ، ی. ژانگ، جی. Ran, B. برآورد مبدا-مقصد برای سفرهای غیر رفت و آمد با استفاده از داده های شبکه اجتماعی مبتنی بر مکان. بین المللی J. Sustain. ترانسپ ۲۰۱۵ ، ۹ ، ۵۵۱-۵۶۴٫ [ Google Scholar ] [ CrossRef ]
  35. جنبش اوبر ۲۰۲۱٫ در دسترس آنلاین: https://movement.uber.com (در ۲۲ نوامبر ۲۰۲۱ قابل دسترسی است).
  36. پایگاه داده GADM مناطق اداری جهانی. ۲۰۱۲٫ در دسترس آنلاین: https://gadm.org/index.html (در ۲۲ نوامبر ۲۰۲۱ قابل دسترسی است).
  37. کروسپه، آ. هابرله، ام. هافمن، ای جی; رود-هسینگر، اس. عبداللهد، ک. Zhu, XX تغییرات در موقعیت‌های جغرافیایی توییتر: بینش و پیشنهادات برای استفاده در آینده. در مجموعه مقالات کارگاه EMNLP 2021 W-NUT: هفتمین کارگاه آموزشی متن تولید شده توسط کاربر پر سر و صدا، آنلاین، ۱۱ نوامبر ۲۰۲۱؛ صص ۲۱۲-۲۲۱٫ [ Google Scholar ]
  38. جدول POI. ۲۰۲۲٫ در دسترس آنلاین: https://gist.github.com/Zia-/d6f3bb5454d0026ea84de7f1086a62f1 (در ۲۶ ژوئن ۲۰۲۲ قابل دسترسی است).
  39. فریمن، ال سی؛ بورگاتی، اس پی؛ وایت، مرکزیت DR در نمودارهای با ارزش: معیاری از بین بودن بر اساس جریان شبکه. Soc. شبکه ۱۹۹۱ ، ۱۳ ، ۱۴۱-۱۵۴٫ [ Google Scholar ] [ CrossRef ]
  40. گائو، اس. وانگ، ی. گائو، ی. لیو، ی. درک ویژگی‌های جریان ترافیک شهری: بازنگری در مرکزیت بین‌المللی. محیط زیست طرح. B طرح. دس ۲۰۱۳ ، ۴۰ ، ۱۳۵-۱۵۳٫ [ Google Scholar ] [ CrossRef ]
  41. رایفر، م. ترویلو، آر. کواتش، اف. اوئر، ام. لوس، ال. مارکس، اس. پرزیبیل، ک. فندریچ، اس. موکنیک، FB؛ Zipf، A. OSHDB: چارچوبی برای تجزیه و تحلیل مکانی-زمانی داده‌های تاریخچه OpenStreetMap. Geospat را باز کنید. نرم افزار داده ایستادن. ۲۰۱۹ ، ۴ ، ۳٫ [ Google Scholar ] [ CrossRef ]
  42. شیاوینا، م. فریره، اس. MacManus، K. GHS Population Grid Multitemporal (1975، ۱۹۹۰، ۲۰۰۰، ۲۰۱۵) R2019A ; کمیسیون اروپا، مرکز تحقیقات مشترک (JRC): بروکسل، بلژیک، ۲۰۱۹؛ جلد ۱۰٫ [ Google Scholar ]
  43. فلورچیک، ا. کوربن، سی. ارلیش، دی. فریره، اس. کمپر، ​​تی. مافنینی، ال. ملچیوری، م. پسری، م. پولیتیس، پ. شیاوینا، م. و همکاران بسته داده GHSL 2019: انتشار عمومی GHS P2019 ؛ دفتر انتشارات اتحادیه اروپا: لوکزامبورگ، ۲۰۱۹٫ [ Google Scholar ]
  44. یانگ، سی. Gidofalvi، G. تطبیق سریع نقشه، الگوریتمی که مدل مارکوف پنهان را با پیش محاسبه ادغام می کند. بین المللی جی. جئوگر. Inf. علمی ۲۰۱۸ ، ۳۲ ، ۵۴۷-۵۷۰٫ [ Google Scholar ] [ CrossRef ]
  45. هستی، تی. طبشیرانی، ر. فریدمن، جی اچ. فریدمن، JH عناصر یادگیری آماری: داده کاوی، استنتاج و پیش بینی . Springer: برلین/هایدلبرگ، آلمان، ۲۰۰۹; جلد ۲٫ [ Google Scholar ]
  46. فیکس، ای. هاجز، JL تجزیه و تحلیل تبعیض آمیز. تبعیض ناپارامتریک: ویژگی های سازگاری. بین المللی آمار کشیش بین المللی آمار ۱۹۸۹ ، ۵۷ ، ۲۳۸-۲۴۷٫ [ Google Scholar ] [ CrossRef ]
  47. بریمن، L. جنگل های تصادفی. ماخ فرا گرفتن. ۲۰۰۱ ، ۴۵ ، ۵-۳۲٫ [ Google Scholar ] [ CrossRef ]
  48. Boser، BE; Guyon، IM; Vapnik، VN یک الگوریتم آموزشی برای طبقه‌بندی‌کننده حاشیه بهینه. در مجموعه مقالات پنجمین کارگاه سالانه تئوری یادگیری محاسباتی، پیتسبورگ، PA، ایالات متحده آمریکا، ۲۷-۲۹ ژوئیه ۱۹۹۲; صص ۱۴۴-۱۵۲٫ [ Google Scholar ]
  49. پدرگوسا، اف. واروکو، جی. گرامفورت، آ. میشل، وی. تیریون، بی. گریزل، او. بلوندل، م. پرتنهوفر، پی. ویس، آر. دوبورگ، وی. و همکاران Scikit-learn: یادگیری ماشینی در پایتون. جی. ماخ. فرا گرفتن. Res. ۲۰۱۱ ، ۱۲ ، ۲۸۲۵-۲۸۳۰٫ [ Google Scholar ]
  50. مهندسی پیش بینی Uber در زمان واقعی با ELK. ۲۰۲۱٫ در دسترس آنلاین: https://www.uber.com/en-DE/blog/elk/ (در ۲۲ نوامبر ۲۰۲۱ قابل دسترسی است).
  51. هنسی، دی. Wiesenthal، DL رابطه بین تراکم ترافیک، استرس راننده و رفتارهای مقابله مستقیم در مقابل غیرمستقیم. ارگونومی ۱۹۹۷ ، ۴۰ ، ۳۴۸-۳۶۱٫ [ Google Scholar ] [ CrossRef ]
  52. بارینگتون-لی، سی. Millard-Ball، A. نقشه راه تولید شده توسط کاربر جهان بیش از ۸۰٪ کامل شده است. PLoS ONE ۲۰۱۷ , ۱۲ , e0180698. [ Google Scholar ] [ CrossRef ] [ PubMed ]
  53. هوانگ، بی. کارلی، KM یک مطالعه تجربی در مقیاس بزرگ از رفتار برچسب‌گذاری جغرافیایی در توییتر. در مجموعه مقالات کنفرانس بین‌المللی IEEE/ACM 2019 درباره پیشرفت‌ها در تجزیه و تحلیل شبکه‌های اجتماعی و استخراج، ونکوور، BC، کانادا، ۲۷ تا ۳۰ اوت ۲۰۱۹؛ ACM: نیویورک، نیویورک، ایالات متحده آمریکا، ۲۰۱۹؛ صص ۳۶۵-۳۷۳٫ [ Google Scholar ] [ CrossRef ]
شکل ۱٫ لایه های مفهومی که به کل زیرساخت SM2T کمک می کند. آنها به ترتیب اولویت روی هم چیده می شوند. لایه Live Traffic با استفاده از دو پراکسی توییتر شناسایی شده، همراه با POI پوشش زمین استفاده از زمین و مرکزیت بین (متن اصلی) ایجاد می شود. توجه داشته باشید که در نقشه سمت چپ فقط پراکسی های توییتر نشان داده شده است.
شکل ۲٫ یک نمونه شبکه خیابانی در شهر هایدلبرگ، آلمان، که نشان می‌دهد ( الف ) چگونه توییت‌های دارای برچسب جغرافیایی بر اساس بافر اطراف بزرگراه‌ها برای پراکسی «تعداد کاربر در بخش جاده» انتخاب شده‌اند، و ( ب ) چگونه یک خوشه توییت با برچسب جغرافیایی در یک فضای عمومی برای پراکسی «تعداد کاربر در مجاورت» استفاده شد.
شکل ۳٫ شکل چهار راه برای جمع آوری داده های POI کاربری و پوشش زمین برای یک کاشی معین را نشان می دهد. برای ( a )، یک شمارش ساده از همه POI ها در یک منطقه مورد علاقه انجام می شود. در ( ب ) یک بافر جاده از پیش تعریف شده، برای هر نوع بزرگراه مختلف، برای انتخاب فقط POIهای نزدیک قبل از شمارش استفاده می شود. در ( ج ) وزن‌های از پیش تعریف‌شده، با توجه به اهمیت زیرساخت، هنگام شمارش استفاده می‌شوند، و در ( د ) یک بافر جاده از پیش تعریف‌شده، برای هر نوع بزرگراه، علاوه بر وزن‌دهی، فقط برای انتخاب و اولویت‌بندی استفاده می‌شود. POI های نزدیک قبل از شمارش
شکل ۴٫ دقت پیش‌بینی سه کلاس ترافیکی که با معیار مرکزیت بین‌المللی مشخص شده‌اند، با کلاس‌های Uber Movement به‌عنوان حقیقت پایه ( سمت چپ ) استفاده می‌شود. رنگ‌ها نشان‌دهنده درصد کاشی‌هایی است که به‌درستی توسط مدل طبقه‌بندی شده‌اند و با استفاده از مرکزیت بین‌گرایی اقتباس‌شده به‌عنوان پیش‌بینی‌کننده، طبقه‌بندی شده‌اند. میزان بیش از حد/کم برآورد در کلاس‌های طبقه‌بندی اشتباه با استفاده از این پراکسی ( راست ). رنگ‌ها سهم کاشی‌هایی را نشان می‌دهند که به اشتباه توسط مدل طبقه‌بندی شده‌اند و با استفاده از مرکزیت بین‌سازی تطبیقی ​​به‌عنوان پیش‌بینی‌کننده، طبقه‌بندی شده‌اند.
شکل ۵٫ نمودار عملکرد دو روش تجمیع توییتر را در هر کاشی مقایسه می‌کند: (i) تعداد کاربر در یک بخش جاده و (۲) تعداد کاربر در یک بخش جاده + تعداد کاربران در یک مجاورت . رنگ نشان‌دهنده تفاوت درصد کاشی‌های طبقه‌بندی صحیح بین پیش‌بینی‌ها بر اساس دو رویکرد است. مقدار مثبت (آبی) نشان می دهد که روش تجمیع با استفاده از ترکیب دو پراکسی پیش بینی بهتری است.
شکل ۶٫ درجه عدم تعادل کلاس در برچسب های HTC در مقابل بدون HTC در هر مجموعه داده بر اساس داده های Uber (تعریف کلاس ایستا). همه نمونه‌هایی که حداقل یک فضای خالی از ویژگی‌ها دارند کنار گذاشته شده‌اند. محور x رابطه بین تعداد کاشی های HTC به کاشی های بدون HTC را در هر شهر برای اندازه های مختلف کاشی نشان می دهد. مقدار ۵۰% داده های کاملاً متعادل را نشان می دهد. “ادغام شده” ترکیبی از تمام یازده شهر را نشان می دهد.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

خانهدربارهتماسارتباط با ما