OSO-YOLOv5: روش استخراج خودکار تابلوهای راهنمای فروشگاه در تصاویر نمای خیابان بر اساس تحلیل چند بعدی


خلاصه
برای تحقق ساخت شهرهای هوشمند، مدیریت دقیق اشیاء مختلف خیابان بسیار مهم است. در برخورد با شکل اشیاء، آن را دنبال هنجارگرایی و دقت می دانند. تابلوهای فروشگاهی جلوه ملموس فرهنگ شهری است. با این حال، به دلیل عواملی مانند ناهمگونی فضایی زیاد، تداخل سایر اجسام زمینی و انسداد، به‌دست آوردن اطلاعات دقیق از تابلوهای فروشگاه‌ها مشکل است. در این مقاله در پاسخ به این مشکل شبکه OSO-YOLOv5 را پیشنهاد می کنیم. بر اساس شبکه YOLOv5، ما ماژول C3 را در ستون فقرات بهبود می‌دهیم و یک مدل ترکیبی هرم فضایی بهبود یافته را پیشنهاد می‌کنیم. در نهایت، کانال و ماژول های توجه فضایی به ساختار گردن اضافه می شوند. تحت محدودیت ویژگی های مستطیلی، این روش توجه مکان و بازسازی توپولوژی را ادغام می کند، استخراج خودکار اطلاعات از تابلوهای فروشگاه را محقق می کند، کارایی محاسباتی را بهبود می بخشد و به طور موثر اثر انسداد را سرکوب می کند. آزمایش‌ها بر روی دو مجموعه داده خود برچسب‌گذاری شده انجام شد. تحلیل کمی نشان می‌دهد که مدل پیشنهادی می‌تواند به دقت بالایی در تشخیص تابلوهای فروشگاهی دست یابد. در مقایسه با سایر روش‌های اصلی تشخیص اشیا، میانگین دقت (AP) 5.0-37.7٪ بهبود یافته است. مهمتر از آن، رویه های مرتبط پتانسیل کاربردی خاصی در زمینه ساخت و ساز شهر هوشمند دارند. آزمایش‌ها بر روی دو مجموعه داده خود برچسب‌گذاری شده انجام شد. تحلیل کمی نشان می‌دهد که مدل پیشنهادی می‌تواند به دقت بالایی در تشخیص تابلوهای فروشگاهی دست یابد. در مقایسه با سایر روش‌های اصلی تشخیص اشیا، میانگین دقت (AP) 5.0-37.7٪ بهبود یافته است. مهمتر از آن، رویه های مرتبط پتانسیل کاربردی خاصی در زمینه ساخت و ساز شهر هوشمند دارند. آزمایش‌ها بر روی دو مجموعه داده خود برچسب‌گذاری شده انجام شد. تحلیل کمی نشان می‌دهد که مدل پیشنهادی می‌تواند به دقت بالایی در تشخیص تابلوهای فروشگاهی دست یابد. در مقایسه با سایر روش‌های اصلی تشخیص اشیا، میانگین دقت (AP) 5.0-37.7٪ بهبود یافته است. مهمتر از آن، رویه های مرتبط پتانسیل کاربردی خاصی در زمینه ساخت و ساز شهر هوشمند دارند.

کلید واژه ها:

شهر هوشمند ؛ تابلوی فروشگاه ; توجه به مکان ؛ بازسازی توپولوژی ; تشخیص شی ؛ تصویر نمای خیابان

۱٫ معرفی

اطلاعات به موقع و دقیق در مورد زیرساخت های شهری یک پیش نیاز مهم و پیوند کلیدی برای ارتقای توسعه مدرن حکمروایی شهری است و همچنین برای اجرای مفهوم “مدیریت تمام چرخه” شهرها و ساخت و ساز از اهمیت زیادی برخوردار است. شهرهای هوشمند [ ۱]. اطلاعات اولیه در مورد زیرساخت های شهری عمدتاً در قالب بررسی های میدانی جمع آوری و خلاصه شد. اگرچه این داده ها نسبتا دقیق هستند، این روش در هنگام بررسی اطلاعات در مقیاس بزرگ در مورد زیرساخت های شهری بسیار پرهزینه است. تصاویر نمای خیابان یک منبع داده سنجش از دور در حال ظهور است که به معیشت مردم مربوط می شود. توسعه شهرهای مدرن، فن آوری ها و روش های جدید برای بهبود سریع سطح به روز رسانی زیرساخت های شهری ضروری است. علاوه بر این، تصاویر نمای خیابان طیف وسیعی از مناطق را پوشش می‌دهند [ ۲ ، ۳]. در نتیجه، تصاویر نمای خیابان به روشی موثر برای به دست آوردن اطلاعات در مورد زیرساخت های شهری به موقع تبدیل شده است. بنابراین، محققان تحقیقاتی را بر روی استخراج اطلاعات در مورد زیرساخت های شهری با استفاده از این منبع داده سنجش از دور در حال ظهور انجام داده اند [ ۴ ، ۵ ، ۶ ].
اطلاعات از تابلوهای فروشگاه ها یکی از مهم ترین منابع اطلاعاتی در مورد زیرساخت های شهری است و برای مدیریت ظاهر شهری، تحلیل توسعه اقتصادی شهری و بازسازی سه بعدی شهری ارزش مهمی دارد [ ۷ ]. با این حال، تا به امروز، مطالعات کمی در مورد استخراج اطلاعات تابلوهای فروشگاهی با استفاده از تصاویر نمای خیابان انجام شده است. در این مطالعه، بر اساس ویژگی هایی که ویژگی های مشابهی با تابلوهای فروشگاهی دارند، تحقیق و تحلیلی انجام دادیم. با نزدیک شدن به تشخیص شی سنتی، روش‌های شی گرا از یک الگوریتم تقسیم‌بندی تصویر [ ۸ ، ۹ ] برای خوشه‌بندی پیکسل‌هایی با ویژگی‌های مشابه برای تشکیل یک واحد ناحیه تقسیم‌بندی شده استفاده می‌کنند و سپس از یک الگوریتم طبقه‌بندی تصویر استفاده می‌کنند. ۱۰ ، ۱۱] برای استخراج اشیاء. با این حال، روش‌های سنتی بر اطلاعات طیفی و بافتی تصاویر در تقسیم‌بندی و طبقه‌بندی تکیه می‌کنند. یعنی بر اساس همگنی پیکسل ها، اشیاء تصویر از پایین به بالا جمع می شوند [ ۱۲ ، ۱۳ ]. با این حال، اطلاعات طیفی تصویر به راحتی تحت تأثیر محیط تصویربرداری، شرایط آب و هوایی، فصول و شرایط عکسبرداری [ ۱۴ ، ۱۵ ]، سایه ها [ ۱۶ ، ۱۷ ]، تغییر شکل رنگ اشیا [ ۱۸ ] قرار می گیرد. ]، همپوشانی اشیا [ ۱۹ ] قرار می گیرد.] و مشکلات دیگر. علاوه بر محدودیت های فوق، چالش اصلی در مورد استفاده از تابلوهای فروشگاهی به عنوان هدف شناسایی این است که شهرها به سرعت در حال توسعه هستند و فروشگاه ها می توانند اندازه های مختلفی داشته باشند. اگرچه تابلوهای فروشگاهی عمدتاً به شکل مستطیل منظم هستند، اما مشخصات، اندازه و رنگ آن بسیار متفاوت است، که منجر به ناهمگونی فضایی بالا و مشکل در استخراج اطلاعات از تابلوهای فروشگاهی می شود. در سطح روش فنی، روش تقسیم بندی و طبقه بندی برای به دست آوردن اشیاء تصویر اساساً ویژگی های سطح بالا مانند اطلاعات ریخت شناسی و اطلاعات بافت معنایی تصاویر را در نظر نمی گیرد. تجمیع پیکسل‌ها که صرفاً بر اساس ویژگی‌های طیفی است، از سایر ویژگی‌های تصاویر نمای خیابان استفاده کامل نمی‌کند. در نتیجه، واحدهای شی به‌دست‌آمده با روش‌های سنتی اغلب با شناخت مورفولوژیکی افراد از اشیاء هدف واقعی مطابقت ندارند، که منجر به شکست طبقه‌بندی سطح شی می‌شود. بنابراین، انجام تحقیقات در زمینه استخراج دقیق اطلاعات از تابلوهای فروشگاهی در مناطق شهری از اهمیت عملی و ارزش کاربردی بالایی برخوردار است.
تا به امروز، وظیفه تفسیر تابلوهای فروشگاهی از تصاویر نمای خیابان عمدتاً توسط چشم انسان انجام شده است. دلیل این امر این است که انسان می تواند ویژگی های فضایی مانند شکل و بافت موجود در تصاویر را به صورت سلسله مراتبی درک کند و بتواند اطلاعات بصری به دست آمده را به صورت سلسله مراتبی استخراج کند تا به استخراج دقیق اطلاعات هدف دست یابد. بنابراین، نحوه استفاده کامل از ویژگی‌های غنی تصاویر نمای خیابان، شبیه‌سازی مکانیسم ادراک بصری انسان، و استخراج واحدهای منطقه‌ای که با اهداف واقعی مطابقت دارند (مانند تابلوهای فروشگاهی که در این مقاله به آنها توجه می‌کنیم) کلید
توسعه سریع شبکه‌های عصبی کانولوشنال (CNN) با تصمیم‌گیری مبتنی بر داده و بهینه‌سازی خود تکراری، دور جدیدی از تحقیقات در تجزیه و تحلیل و درک تصویر [ ۲۰ ] را ارتقا داده و همچنین به توسعه سریع تشخیص بصری هدف منجر شده است. ۲۱ ، ۲۲ ، ۲۳ ]. یادگیری بازنمایی از طریق شبکه های عمیق می تواند انتزاع چند سطحی را در تجزیه و تحلیل تصویر معنایی انجام دهد، به این معنی که می تواند از روش های سنتی در کاربردهای سنجش از دور بسیار بهتر عمل کند [ ۲۴ ]. ]. در زمینه پردازش تصویر، یادگیری عمیق را می توان به تقسیم بندی معنایی و تشخیص اشیاء تقسیم کرد [ ۲۵]. استخراج ویژگی معنایی چند مقیاسی بر اساس تقسیم‌بندی معنایی و تشخیص شی دارای ویژگی‌های بازده و اتوماسیون بالا است که می‌تواند عملی بودن تشخیص تابلوهای فروشگاه را بهبود بخشد.
در تحقیق بر روی تقسیم‌بندی معنایی، به منظور حل مشکل رایج اشیاء در تصاویر نمای خیابان، یعنی تنوع مقیاس، شبکه‌های کاملاً کانولوشنال (FCNs) [ ۲۶ ] معمولاً با لایه‌های کانولوشنال متعدد و لایه‌های همگرایی انباشته می‌شوند [ ۲۷ ، ۲۸ ] ]. برای مثال، DeepLabv3 [ ۲۹ ] یک ماژول ادغام هرم فضایی آتروس (ASPP) را معرفی می‌کند و از پیچش آتروس به صورت آبشاری یا موازی برای گرفتن بافت چند مقیاسی با نرخ‌های آتروس مختلف [ ۳۰ ، ۳۱ ] و U-Net [ ۳۲ ] استفاده می‌کند. الحاق نقشه ها را در سطوح مختلف نشان می دهد [ ۳۳ ، ۳۴]. با این حال، با این روش‌های تقسیم‌بندی مبتنی بر پیکسل، خروجی اغلب لبه‌های نامنظم و گوشه‌های بیش از حد صاف را نشان می‌دهد [ ۳۵ ]. کار قبلی در مورد تشخیص بیلبورد، مشکل تشخیص را به عنوان یک مشکل تقسیم بندی معنایی در نظر گرفته است [ ۳۶ , ۳۷]، انجام طبقه بندی و محلی سازی در سطح پیکسل تصویر. با این حال، از نقطه نظر کاربردی، حاشیه نویسی برای تقسیم بندی معنایی تصویر وقت گیرتر است، که دشواری ساخت مجموعه داده های بزرگ را افزایش می دهد. نکته دیگر این است که خروجی تقسیم بندی معنایی معمولاً به صورت گرافیک های نامنظم است، در حالی که شکل هندسی تابلوهای فروشگاه ها عمدتاً مستطیلی است. این با خروجی تشخیص اشیا مطابقت دارد، به طوری که روش های تشخیص اشیا برای کار تشخیص تابلوهای فروشگاه مناسب تر هستند.
در تحقیقات تشخیص اشیا، اکثر اشیاء تحقیقاتی مشکلات مشابهی برای ذخیره تابلوهای راهنما دارند. به عنوان مثال، برای رسیدگی به مشکلات انسداد و اهداف کوچک، Xu et al. [ ۳۸ ] از یک تابع از دست دادن دفعی برای حل مشکل انسداد هدف استفاده کرد و یک شبکه فرعی دو جهته آگاه از مقیاس برای شناسایی اهداف در دو مقیاس استفاده شد. سپس در پایان استنتاج، آمیختگی ادراکی انجام شد. موررا و همکاران برای مکان هدف پوشیده شده توسط یک پنجره شفاف. [ ۳۹ ] از یک مجموعه داده برچسب‌گذاری شده خود استفاده کرد و روش‌های مختلف افزایش داده را به همراه توابع از دست دادن مانند از دست دادن محلی‌سازی اعمال کرد. وانگ و همکاران با هدف حل مشکلات نسبت پیکسل پایین اشیاء پیش زمینه و تفاوت های قابل توجه مقیاس های شیء. [ ۴۰] FSoD-Net را پیشنهاد کرد که یک هسته لاپلاس را با لایه‌های کانولوشنال چند مقیاسی موازی کمتری ادغام می‌کند و سه لایه شاخه رگرسیون جدا شده متفاوت را در بر می‌گیرد و امتیاز طبقه‌بندی جعبه‌های مرزی پیش‌بینی‌شده را بهبود می‌بخشد. یک مدل یادگیری عمیق را می توان برای دستیابی به طبقه بندی و استخراج انواع مختلف اشیاء در تصویر استفاده کرد، اما نمی تواند به اثر تفسیر بصری مصنوعی دست یابد، یعنی هر نوع شی باید با توجه به ویژگی های بصری خاص خود در نظر گرفته شود. [ ۴۱ ، ۴۲ ، ۴۳ ، ۴۴]. تابلوهای راهنمای فروشگاه ها معمولاً در وسط تصاویر نمای خیابان متمرکز می شوند و اغلب توسط درختان مسدود می شوند. این انسدادها اطلاعات هدف را تکه تکه می کنند و رابطه توپولوژیکی را از بین می برند. علاوه بر این، تابلوهای راهنما و تابلوهای تاکسی در صحنه نیز می توانند با تابلوهای فروشگاه تداخل داشته باشند. روشی برای طراحی یک روش شناسایی معقول و مؤثر با توجه به ویژگی های تابلوهای فروشگاهی در تصاویر نمای خیابان باید در هنگام ساخت یک مدل در نظر گرفته شود.
در این مطالعه، ما بر اساس جدیدترین نسخه YOLO پیشنهاد شده توسط Ultralytics [ ۴۵ ]، که شبکه ای است که اغلب با نام YOLOv5 نامیده می شود، ساخته ایم تا از دقت تشخیص بالا و استدلال سریع آن بهره ببریم. ما شبکه OSO-YOLOv5 را پیشنهاد می‌کنیم که توجه مکان و بازسازی توپولوژی را تحت محدودیت ویژگی‌های مستطیلی یکپارچه می‌کند. با آزمایش‌های فراوان، امکان‌سنجی و کارایی این روش برای استخراج تابلوهای فروشگاهی در محیط‌های مختلف شهری بررسی شد.
آثار اصلی این مقاله را می توان به شرح زیر خلاصه کرد:
(۱) ما اطلاعات مختصات را قبل از لایه کانولوشن در ساختار ستون فقرات اضافه می کنیم که باعث می شود روش تا حدی از موقعیت آگاه باشد.
(۲) ما ماژول C3 را در ساختار ستون فقرات با بهبود بافت مقیاس و اطلاعات زمینه محله، که به ماژول جدید C3 محدودیت‌های ویژگی مستطیلی شکل و یک تابع بازسازی توپولوژی می‌دهد، بهبود می‌بخشیم.
(۳) ما یک مدل ادغام هرم فضایی بهبود یافته را برای کاهش بار محاسباتی و بهبود توانایی یادگیری غیرخطی مدل با آبشاری استخرهای هسته کوچک پیشنهاد می‌کنیم. علاوه بر این، ما کانال‌ها و ماژول‌های توجه فضایی را اضافه می‌کنیم تا تضعیف ویژگی‌ها به دلیل فرآیند تحویل را برطرف کنیم.
بقیه این مقاله به شرح زیر سازماندهی شده است: بخش ۲ جزئیات روش پیشنهادی را ارائه می کند. نتایج تجربی و تجزیه و تحلیل در بخش ۳ ارائه شده است. در نهایت، نتایج ما در بخش ۴ آورده شده است.

۲٫ روش ها

در محیط پیچیده و متغیر شهری، در مقیاس‌های مختلف ساخت و ساز و اشکال برنامه‌ریزی، تابلوهای فروشگاهی می‌توانند ویژگی‌های مورفولوژیکی بسیار متفاوتی را ارائه دهند. اطلاعات مورفولوژیکی بصری ویژگی اصلی استخراج اطلاعات تابلوهای فروشگاهی در تصاویر نمای خیابان است. از این رو با توجه به ویژگی های تابلوهای فروشگاهی در تصاویر نمای خیابان، روشی برای استخراج اطلاعات تابلوهای فروشگاهی معرفی می کنیم که از قابلیت انتزاع ویژگی چند سطحی و سرعت بالای شبکه YOLOv5 بهره می برد.

۲٫۱٫ تجزیه و تحلیل ویژگی های بصری

با توجه به تفاوت در محیط های خیابان و مقیاس فروشگاه، تابلوهای فروشگاهی ویژگی های بصری متفاوتی را در تصاویر نمای خیابان ارائه می دهند. بنابراین، بر اساس ویژگی‌های هندسی، ویژگی‌های بافتی و ویژگی‌های مکان تابلوهای فروشگاهی در تصاویر نمای خیابان، می‌توان آنها را به سه نوع تقسیم کرد: (۱) تابلوهای فروشگاهی بدون انسداد. (۲) تابلوهای راهنما را با درجه انسداد جزئی ذخیره کنید. و (۳) تابلوهای راهنما را با درجه انسداد بالا ذخیره کنید. مشخصات انواع تابلوهای فروشگاهی در جدول ۱ خلاصه شده است.
علاوه بر این، شکل ۱تصاویر نمای خیابان را با انواع مختلف تابلوهای راهنمای فروشگاه نشان می دهد و ویژگی های بصری آنها را توضیح می دهد: (۱) تابلوهای فروشگاهی بدون انسداد معمولاً دارای مرزهای واضح، بافت داخلی نسبتاً یکنواخت هستند و معمولاً از نظر فضایی در وسط تصاویر توزیع و متمرکز می شوند. آنها همچنین مورفولوژی مستطیلی واضحی را ارائه می دهند. (۲) تابلوهای فروشگاه با انسداد جزئی دارای اطلاعات مرزی ناقص، بافت ناهموار، شکل مستطیل شکل نسبتاً تار هستند و بیشتر در وسط تصاویر متمرکز شده اند. (۳) تابلوهای فروشگاه با درجه انسداد بالا دارای ویژگی‌های مرزی مبهم یا اساساً غیرقابل‌وجود هستند و بافت نامرتب است. با این حال، شکل مستطیل را می توان با توجه به دانش قبلی تعیین کرد و بیشتر تابلوهای راهنما در وسط تصاویر متمرکز شده اند.
به طور خلاصه، در روش پیشنهادی، ما ویژگی‌های مشترک تابلوهای فروشگاه را در نظر می‌گیریم – شکل مستطیلی و موقعیت توزیع شده در مرکز – و محدودیت‌های ویژگی مستطیلی و ادراک را به شبکه اضافه می‌کنیم. از آنجایی که عامل تداخل اصلی در تشخیص خودکار تابلوهای فروشگاهی انسداد است، ما برای شناسایی آنها به بافت داخلی تابلوهای فروشگاه تکیه می کنیم و یک ماژول بازسازی توپولوژی را ادغام می کنیم. ما همچنین مشکل رایج اشیاء در تصاویر نمای خیابان – ویژگی های چند مقیاسی – را در نظر می گیریم و یک ماژول درک چند مقیاسی را معرفی می کنیم.

۲٫۲٫ مدل پیشنهادی

مدل طراحی شده در این مطالعه شامل دو بخش اصلی است: (۱) ستون فقرات، همانطور که در کادر آبی در شکل ۲ نشان داده شده است. در مرحله اول، ماژول با توجه به شکل و توزیع فضایی تابلوهای فروشگاه، با در نظر گرفتن محدودیت‌های ویژگی‌های مستطیلی، توجه به مکان و بازسازی توپولوژی، سازمان‌دهی مجدد می‌شود. لایه CoordConv، ماژول C3_SC و ماژول C3 به منظور بهبود دقت استخراج ویژگی طراحی شده اند. ماژول بهبود یافته ادغام هرم فضایی (IFSPP) برای اطمینان از عملکرد آگاه از مقیاس و بهبود توانایی تعمیم مدل، بدون افزایش میزان محاسبه مدل استفاده می‌شود. (۲) گردن، همانطور که در کادر قرمز نشان داده شده است شکل ۲ نشان داده شده است، برای اطمینان از کفایت و دقت استفاده از ویژگی در فرآیند گسترش از ترکیب سطح بالا به سطح پایین ویژگی ها با معنایی قوی استفاده می شود و یک ماژول توجه اضافه می کند. معماری شبکه برای سناریوهای پیچیده قوی است و برای اهداف تحقیق این مقاله قابل استفاده است.

۲٫۲٫۱٫ بهبودهایی در ستون فقرات

شبکه ستون فقرات YOLOv5 عمدتا از ماژول های Focus، Conv، C3 و هرم فضایی (SPP) تشکیل شده است. در میان این ماژول ها، ماژول Conv ( شکل ۳ الف)، به عنوان یک ماژول کلیدی برای تبدیل دو نمایش فضایی (مختصات مکانی دکارتی (i, j) و مختصات مکانی پیکسل)، دارای نقص است، زیرا مختصات موقعیت خاص در به دست نمی آید. ورودی. ماژول C3 ( شکل ۳ ب) به عنوان یک ماژول کلیدی برای شبکه برای یادگیری ویژگی های بیشتر عمل می کند. از آنجایی که ساختار داخلی مطابق با ویژگی‌های تابلوهای فروشگاهی و ویژگی‌های تصویر طراحی نشده است، تنها از کانولوشن هسته ۳×۳ برای استخراج ویژگی‌ها استفاده می‌شود که در نتیجه کسب ویژگی محدود است. وابستگی های جهانی/راه دور بسیاری از وظایف بینایی کامپیوتر را انجام می دهند [ ۴۶]، اما میدان پذیرش محدود پیچیدگی مانع از مدل‌سازی چنین روابط تعاملی از راه دور می‌شود. ماژول SPP ( شکل ۳ ج) می تواند میدان دریافتی را تا حد زیادی افزایش دهد و مهم ترین ویژگی های زمینه ای را از هم جدا کند. با این حال، برای اشیاء مستطیلی در این مطالعه، یک پنجره ادغام بیش از حد بزرگ نه تنها مقدار محاسبات را افزایش می‌دهد، بلکه می‌تواند اطلاعات نامربوط دیگری را نیز در خود جای دهد. با توجه به مشکلات فوق، ما تحقیقات طراحی ماژول را انجام دادیم.
(۱)
محل توجه
تابلوهای راهنمای فروشگاه ها بیشتر در وسط تصاویر نمای خیابان متمرکز شده اند. به عنوان یک ماژول کلیدی برای تبدیل فضای مختصات، ساختار کانولوشن استاندارد دارای ویژگی های عالی مانند معادل سازی ترجمه، اتصال محلی و اشتراک وزن است. به‌عنوان بلوک اصلی مدل‌های مختلف، موفقیت زیادی در زمینه‌های بینایی کامپیوتری مختلف به دست آورده است. برخی از دستاوردهای اخیر در بینایی ماشین بر روی هم قرار دادن تعداد زیادی ساختار کانولوشن متکی است. با این حال، در کار مدل‌سازی مختصات شی، پیچیدگی عمومی نمی‌تواند اطلاعات مختصات موقعیت خاصی را به دست آورد، و نمی‌تواند عملکرد صاف بین فضای دکارت و فضای پیکسل را بیاموزد [ ۴۷ ].
به منظور بهبود اثر کانولوشن و بهبود عملکرد آگاه از مکان، لایه CoordConv [ ۴۷ ] را برای جایگزینی لایه پیچشی در ستون فقرات معرفی می‌کنیم. یعنی کانال های i- coordinate و j -coordinate به ورودی اضافه می شوند. ساختار دقیق لایه CoordConv در شکل ۴ نشان داده شده است . لایه CoordConv دو ویژگی اصلی لایه کانولوشن را حفظ می کند: پارامترهای کمتر و راندمان محاسباتی بالا. همچنین این قابلیت را دارد که پیکسل های یک تصویر را از طریق یک شبکه تشخیص هدف مشاهده کند و کارایی جعبه مرزی خروجی را در سیستم مختصات دکارتی بهبود بخشد.
(۲)
محدودیت ویژگی مستطیلی
همانطور که در شکل ۱ نشان داده شده است اکثر تابلوهای راهنمای فروشگاه ها به شکل مستطیل های چند مقیاسی هستند . برای درک ویژگی های مستطیلی چند مقیاسی، زمینه مقیاس بیشتری مورد نیاز است. روش های مقیاس شامل پیچیدگی خالی و ادغام جهانی است. اطلاعات متنی ناهمسانگرد به طور گسترده ای در سناریوها وجود دارد، و برای تابلوهای فروشگاهی مستطیلی شکل، استفاده از هسته کانولوشن مربعی برای گرفتن اطلاعات، اطلاعات مناطق نامرتبط را ادغام کرده و انعطاف پذیری را از دست می دهد.
برای به تصویر کشیدن زمینه مقیاس در اطلاعات متنی، ما بهبودهایی را بر اساس ماژول C3 معرفی کردیم و از یک ماژول ادغام نواری (SP) [ ۴۸ ] برای جایگزینی لایه کانولوشن ۳ × ۳ زیرماژول گلوگاه در ماژول C3 استفاده کردیم. همانطور که در شکل ۵ نشان داده شده است ، یک شکل هسته بلند ابتدا در امتداد یک بعد فضایی مستقر شده است. سپس یک شکل هسته باریک در بعد فضایی دیگر حفظ می شود. چنین ساختاری می‌تواند به ثبت ویژگی‌های ساختار باند دوربرد تابلوهای فروشگاه کمک کند و از تداخل مناطق نامرتبط با پیش‌بینی برچسب جلوگیری کند.
(۳)
بازسازی توپولوژیکی
همانطور که در شکل ۱ نشان داده شده است ، تابلوهای راهنمای فروشگاه ها معمولا در وسط تصاویر نمای خیابان قرار دارند و به راحتی توسط درختان مسدود می شوند و در نتیجه اطلاعات هدف ناقص است. اطلاعات متنی برای یادگیری توپولوژی های قابل اعتماد و پایدار بسیار مهم است، بنابراین باید اطلاعات زمینه ای بیشتری را از نزدیک ترین همسایگان در نظر بگیریم. توجه به خود به طور گسترده در شبکه های عصبی عمیق برای گرفتن همبستگی داخلی ویژگی ها و ایجاد روابط توپولوژیکی صحیح استفاده می شود [ ۴۹ ]. با این حال، مکانیسم سنتی توجه به خود تنها تبادل اطلاعات را در حوزه فضایی انجام می دهد و از اطلاعات زمینه ای غنی بین همسایگان نزدیک غفلت می کند.
با تمرکز بر اطلاعات متنی بین همسایگان، ما بهبودهایی را بر اساس ماژول C3 معرفی کردیم و از یک ماژول ترانسفورماتور متنی (CoT) [ ۴۹ ] برای جایگزینی لایه کانولوشن ۳ × ۳ زیرماژول گلوگاه در ماژول C3 استفاده کردیم. ماژول CoT ( شکل ۶) ابتدا کلیدهای ورودی را با پیچیدگی ۳×۳ رمزگذاری می کند تا نمایش متنی استاتیک ورودی را به دست آورد و سپس کلیدهای کدگذاری شده را با پرس و جوی ورودی متصل می کند. ماتریس پویای توجه چند سر با دو انحراف متوالی ۱×۱ آموخته می شود و ماتریس توجه در مقادیر ورودی ضرب می شود تا نمایش زمینه پویا ورودی به دست آید. خروجی این ماژول حاصل ادغام بیان زمینه ایستا و بیان زمینه پویا است. این ماژول استخراج اطلاعات متنی و یادگیری خودتوجهی را در یک چارچوب یکپارچه ادغام می کند، اطلاعات زمینه ای همسایگان نزدیک را کاوش می کند، روابط توپولوژیکی درستی ایجاد می کند و مشکل تکه تکه شدن شی را تا حدی حل می کند.
(۴)
استخراج اطلاعات در مقیاس چندگانه
با توجه به مسئله چند مقیاسی موضوع تحقیق این مطالعه، یک مدول توجه فشاری هرمی (PSA) [ ۵۰ ] معرفی شده است، همانطور که در شکل ۷ نشان داده شده است.آ. این ماژول جایگزین پیچیدگی ۳×۳ گلوگاه در ماژول C3 می شود و ماژول جدید C3 ماژول C3_P نامیده می شود. با استفاده از ساختار پیچشی هرمی چند مقیاسی برای ادغام اطلاعات نقشه ویژگی ورودی، می توان اطلاعات مکانی مقیاس های مختلف را از نقشه ویژگی هر کانال استخراج کرد. با استخراج وزن‌های توجه نقشه‌های ویژگی چند مقیاسی، تعامل متقاطع تحقق می‌یابد. از یک سو، اطلاعات مکانی مقیاس‌های مختلف برای غنی‌سازی فضای ویژگی جمع‌آوری می‌شود. از سوی دیگر، پیچیدگی گروهی همراه با توجه کانال به استخراج اطلاعات ویژگی های پنهان بیشتر کمک می کند. زیر ماژول گلوگاه در ماژول C3_P همانطور که در شکل ۸ نشان داده شده است طراحی شده است .
ماژول SPP بیشتر یک میدان گیرنده چند مقیاسی را ادغام می کند. در ترکیب با تنوع مقیاس و ویژگی های مستطیلی اشیاء تحقیق، استفاده از یک پنجره ادغام بزرگ، بار محاسباتی را افزایش می دهد و می تواند اطلاعات نامربوط دیگر را ادغام کند. اگر دو لایه ترکیبی با ۳ × ۳ هسته را روی هم قرار دهیم، میدان دریافت موثر ۵×۵ پیکسل است [ ۵۱ ]. به طور مشابه، یک پشته تلفیقی با چهار هسته ۳ × ۳، ۹ × ۹ پیکسل است و یک پشته تلفیقی با شش هسته ۳ × ۳، ۱۳ × ۱۳ پیکسل است. مقدار محاسبه برای یک هسته ۵ × ۵ ۲۵/۹ = ۲٫۷۸ برابر برای یک هسته ۳ × ۳ با همان تعداد فیلتر است. بنابراین، به منظور بهبود عملکرد مقیاس آگاه، یک پشته تلفیقی از هسته‌های کوچک طراحی شد و ماژول IFSPP پیشنهاد شد، همانطور که در نشان داده شده است.شکل ۹ . علاوه بر کاهش پیچیدگی محاسباتی، ادغام هسته با اندازه کوچک دارای غیرخطی بیشتر (لایه‌های بیشتر توابع غیرخطی) است که تابع تصمیم را حیاتی‌تر می‌کند و به عنوان منظم‌سازی ضمنی عمل می‌کند و قابلیت تعمیم مدل را بیشتر بهبود می‌بخشد.
(۵)
طراحی معماری موازی
عمق بیان شبکه را افزایش می دهد و به یادگیری بیشتر و بیشتر ویژگی های انتزاعی کمک می کند. با این حال، یک شبکه عمیق تر بدون اشکال نیست [ ۵۲]. یک شبکه عمیق تر منجر به پردازش متوالی بیشتر و تاخیر بیشتر می شود که موازی سازی آن را سخت تر می کند و برای برنامه هایی که نیاز به پاسخ سریع دارند مناسب تر است. در رویکرد پیشنهادی، یک شبکه فرعی موازی برای کاهش عمق و حفظ عملکرد بالا با در نظر گرفتن ویژگی‌های هندسی و ساختار موقعیتی تابلوهای فروشگاه طراحی شد. ما یک معماری گلوگاه موازی در نمودار ویژگی کم عمق، که در اولین ماژول C3 است، طراحی کردیم و نام این ماژول را ماژول C3_SC گذاشتیم. این نقشه ویژگی موقعیت مکانی دارای وضوح بالاتری است، به طوری که می توان اطلاعات بافتی بیشتر و واضح تری به دست آورد. در نتیجه، اطلاعات ویژگی های مفیدتری را می توان به طور موثر و مناسب استخراج کرد و یک رابطه توپولوژیکی پایدار ایجاد کرد. زیر ماژول گلوگاه در ماژول C3_SC مطابق شکل طراحی شده استشکل ۱۰ .
۲٫۲٫۲٫ بهبود در ناحیه گردن
یک راه اساسی برای به دست آوردن ویژگی های قابل اعتماد، طراحی ساختار ستون فقرات بر اساس ویژگی های هدف تحقیق است. علاوه بر این، هنوز باید از کفایت و دقت استفاده از ویژگی اطمینان حاصل کنیم. ساختار گردن ویژگی‌های معنایی، از همجوشی سطح بالا تا سطح پایین را درک می‌کند و نقشه‌های ویژگی جدیدی تولید می‌کند. با این حال، در این فرآیند، اطلاعات مهم ممکن است از دست بروند. با توجه به این موضوع، ما تحقیق زیر را انجام دادیم: تابلوهای فروشگاهی متعلق به اهداف چند مقیاسی هستند و ویژگی های همجوشی چند مقیاسی دقیق پیش نیازی برای به دست آوردن نتایج تشخیص دقیق است. مطالعات نشان داده اند که توجه کانال، توجه فضایی، یا هر دو می توانند به طور قابل توجهی توانایی بازنمایی ویژگی را بهبود بخشند [ ۵۳ ، ۵۴]. بر اساس تحقیق در مورد مکانیسم های توجه توسط Woo et al. [ ۵۵ ]، ما توجه فضایی و کانالی نقشه ویژگی را با هم ترکیب کردیم و آن را مجدد کالیبره کردیم تا تشخیص هرم فعلی را بهبود بخشیم. بنابراین، ما یک ماژول توجه را در هر مرحله از ساختار تجمیع مسیر ادغام می‌کنیم تا ویژگی‌های هرمی را با وزن‌دهی به نقشه ویژگی ذوب‌شده، تقویت کنیم. ماژول توجه ابتدا وابستگی ویژگی هر لایه از نقشه ویژگی هرم را مدل می کند، بردار اهمیت ویژگی را بیشتر مطالعه می کند، نقشه ویژگی را مجددا کالیبراسیون می کند و بر ویژگی های مفید تأکید می کند. ماژول توجه شامل دو بخش اصلی است: (۱) بلوک توجه کانال (CAB). و (۲) یک بلوک توجه فضایی (SAB) ( شکل ۱۱ ).
(۱)
بلوک توجه کانال

CAB بر تقویت ویژگی‌ها در امتداد کانال هر سطح هرم تمرکز دارد. ابتدا به صراحت وابستگی ویژگی ها را در امتداد کانال مدل می کند و یک توصیفگر خاص کانال را از طریق روش فشرده سازی و تحریک می آموزد. سپس بر کانال‌های مفید برای بیان اطلاعات جهانی کارآمدتر نقشه‌های ویژگی در هر سطح هرم تأکید می‌کند. CAB را می توان به صورت زیر بیان کرد:

مج FσمPgپFمPمPF)) )مج(اف)=�(م�پ(آ��پ��ل(اف))+م�پ(مآایکسپ��ل(اف)))
ورودی یک مشخصه F از H × W × C است. ما ابتدا یک ادغام میانگین جهانی و یک ادغام حداکثر در فضا را انجام می دهیم و دو توصیف کانال ۱ × ۱ × C را به دست می آوریم که σ یک واحد خطی اصلاح شده (ReLU) است. عملکرد فعال سازی سپس اینها به یک شبکه عصبی دو لایه وارد می شوند، که تعداد نورون های لایه اول C/r، تابع فعال سازی ReLU، و تعداد نورون ها در لایه دوم C است. این عصبی دو لایه است. شبکه به اشتراک گذاشته شده است سپس ضریب وزنی C با افزودن دو ویژگی و عبور تابع فعال سازی سیگموئید به دست می آید. در نهایت، ویژگی جدید را می توان با ضرب ضریب وزن در ویژگی اصلی F بدست آورد.
(۲)
بلوک توجه فضایی

مشابه CAB، بلوک توجه فضایی (SAB) ویژگی ها را همراه با مکان فضایی هر سطح هرم افزایش می دهد، که بر پیکسل های موثر تأکید می کند و پیکسل های بی اثر یا کم اثر را سرکوب می کند. فرآیند SAB را می توان به صورت زیر بیان کرد:

ماسافσ(f۷ ۷ )gپF؛ مPFσ(f۷ ۷ )[افآvgاس;افمترآایکساس)��(�)=�(�(۷*۷)([�������(�);�������(�)]))=�(�(۷*۷)([�����;�����]))
با توجه به یک مشخصه F از H × W × C، ابتدا استخر و حداکثر بعد کانال را به طور میانگین جمع می کنیم تا دو توصیف کانال H × W × ۱ را به دست آوریم و سپس آنها را به هم وصل می کنیم. سپس، از طریق یک لایه کانولوشن ۷ × ۷، σ تابع فعال سازی سیگموئید است و ضریب وزنی S به دست می آید. در نهایت، ویژگی جدید را می توان با ضرب ضریب وزن و ویژگی F به دست آورد.
به طور خلاصه، تمرکز ماژول توجه کانال یادگیری اطلاعات کانال از ترکیب ویژگی های ناهمگن است و تمرکز ماژول توجه فضایی یادگیری اطلاعات مکانی از ترکیب ویژگی ها است. این بهبود ویژگی مبتنی بر توجه می‌تواند به‌طور خودکار اهمیت سطوح مختلف ویژگی‌ها را بررسی کند، به طور موثر مناطق ناهمگن را در ابعاد کانال ادغام کند، و اهمیت هر موقعیت پیکسل را در ابعاد فضایی برای نزدیک‌تر شدن به منطقه مورد نظر دوباره تنظیم کند. بنابراین، از قضاوت نادرست ناشی از تاری ویژگی جلوگیری می کند و توانایی ماژول تشخیص را برای تشخیص تابلوهای فروشگاه و پس زمینه بهبود می بخشد.

۳٫ نتایج

۳٫۱٫ راه اندازی آزمایشی

۳٫۱٫۱٫ تولید مجموعه داده

تا جایی که نویسندگان می دانند، هیچ مجموعه داده عمومی برای تشخیص تابلوهای فروشگاهی وجود ندارد. حتی مجموعه داده چینی Text in Wild (CTW) [ ۵۶ ] هیچ نمونه ای از برچسب گذاری تابلوهای فروشگاهی ندارد. به منظور تأیید عملکرد و استحکام الگوریتم پیشنهادی، ما دو مجموعه داده را برای ارزیابی روش توضیح دادیم. تصاویر منتخب نمای خیابان از دو منبع داده بدست آمدند: CTW [ ۵۶] و بایدو. تصاویر نمای خیابان CTW عمدتاً از داده های تصویر نمای خیابان Tsinghua Tencent 100k و Tencent تشکیل شده است. نمای خیابان Baidu عمدتاً بر اساس داده های تصویری است که از اینترنت خزیده شده است. تصاویر نمای خیابان دو منبع داده، مناطق وسیعی را در مناطق مختلف با وضوح تصویر متفاوت پوشش می‌دهند، و هر دو مجموعه داده شامل صحنه‌هایی با شرایط نوری متعدد، درجات متعدد انسداد و همپوشانی هدف هستند.
به منظور آموزش یک مدل قوی تر با استفاده از مجموعه داده های کوچک به دست آمده از شرایط محیطی پیچیده، از روش برچسب گذاری آنچه می بینید (LWYS) [ ۵۷ ] برای برچسب گذاری استفاده شد و تنها اهداف تصویربرداری نمای جلو در نظر گرفته شد، تا موارد تشخیص اشتباه و تشخیص نادرست را کاهش دهید. ما ۶۴۷ تصویر نمای خیابان CTW را انتخاب کردیم. تابلوهای فروشگاهی طبق استانداردهای ذکر شده در بخش ۲ به سه دسته تقسیم شدند-۱٫ در مجموع ۲۹۹۵ هدف با استفاده از LWYS مشخص شدند که نسبت هدف تابلوهای فروشگاه بدون انسداد، تابلوهای فروشگاه با انسداد جزئی و تابلوهای فروشگاه با انسداد سنگین ۱:۲:۲ بود. نیازی به در نظر گرفتن طبقه بندی در کار تشخیص واقعی نیست، اما آموزش چند طبقه بندی می تواند تابلوهای فروشگاه و پس زمینه را تا حد زیادی از هم جدا کند. بنابراین، هنگامی که ما دقت را ارزیابی می کنیم، اهداف شناسایی شده را با توجه به الزامات وظیفه واقعی، به عنوان مثال، تابلوهای راهنما ذخیره می کنیم.
تولید یک مدل تشخیص هدف مبتنی بر یادگیری عمیق بر اساس آموزش با حجم زیادی از داده های تصویری محقق می شود. بنابراین، تصاویر نمای خیابان ۶۴۷ CTW نیاز به بهبود داشتند و یک تصویر اصلی به ۴ ارتقا یافت. روش های بهبود تصویر شامل افزایش و کاهش روشنایی تصویر، آینه کاری افقی، بزرگنمایی، ترجمه و غیره بود. علاوه بر این، در فرآیند گرفتن تصویر، تکان دادن دستگاه اکتساب یا شاخه های درخت می تواند باعث تار شدن تصویر شود، بنابراین ما یک فیلتر گاوسی برای شبیه سازی این نوع پدیده تاری اضافه کردیم. به منظور افزایش تنوع تصاویر ورودی و استحکام بیشتر مدل نسبت به تصاویر به دست آمده در محیط های مختلف، ۲۴۱ تصویر از بین تصاویر نمای خیابان CTW همزمان با تصاویر اصلی برش داده شد و آموزش داده شد.
ما از داده های تصویر CTW برچسب دار برای انجام آموزش استفاده کردیم. پس از بهبود داده ها، کتابخانه نمونه از ۳۶۳۷ تصویر نمای خیابان، شامل ۱۳۲۴۴ شی تابلوی فروشگاه تشکیل شد. اندازه های تصویر شامل ۲۰۴۸ × ۲۰۴۸ و ۱۲۰۰ × ۱۰۲۴ بود و نسبت مجموعه آموزشی، مجموعه تأیید و مجموعه تست ۸:۱:۱ بود. به منظور بررسی قابلیت تعمیم مدل، از ۳۰۰ تصویر نمای خیابان بایدو در اندازه های مختلف برای ارزیابی دقت مدل، از جمله ۱۶۴۳ تابلوی فروشگاه استفاده شد.
۳٫۱٫۲٫ آموزش شبکه
آزمایش‌ها بر روی یک رایانه Dell با پردازنده Core (TM) i7-9700 @ 3.00 گیگاهرتز، ۲۸ گیگابایت رم و یک پردازنده گرافیکی NVIDIA GeForce RTX 2060 انجام شد. چارچوب یادگیری عمیق PyTorch در ویندوز ۱۰ اجرا شد و کد برنامه به زبان پایتون نوشته شد. کتابخانه های CUDA، CuDNN، OpenCV و دیگر کتابخانه ها برای آموزش و آزمایش مدل های تشخیص هدف استفاده شدند.
از آنجایی که اندازه ورودی مورد نیاز برای شبکه YOLOv5 ثابت است، اندازه تصویر را به اندازه یکنواخت ۶۴۰ × ۶۴۰ تنظیم کردیم. لایه (BN). مومنتوم روی ۰٫۹۳۷ و نرخ کاهش وزن روی ۰٫۰۰۰۵ تنظیم شد. تعداد جلسات تمرین ۵۰۰ جلسه تعیین شد و پس از پایان آموزش فایل وزن مدل تشخیص ذخیره شد و عملکرد مدل با استفاده از مجموعه تست مورد ارزیابی قرار گرفت.
۳٫۱٫۳٫ شاخص های ارزیابی

در این مقاله، عملکرد مدل بر روی مجموعه‌های داده مختلف با استفاده از دقت، یادآوری، تقاطع روی اتحاد (IoU)، امتیاز F1 و دقت متوسط ​​(AP) ارزیابی می‌شود. فرمول این شاخص ها به شرح زیر است. IoU به عنوان منطقه تقاطع پیش بینی و حقیقت زمین تقسیم بر مساحت مجموعه اتحادیه تعریف می شود. AP میانگین تقاطع مقادیر ۱۰ IoU را با آستانه ۰٫۵۰ تا ۰٫۹۵ و اندازه گام ۰٫۰۵ محاسبه می کند.

دقت =تیپتیپافپدقت، درستی=تیپتیپ+افپ
یادآوری =تیپتیپافنبه خاطر آوردن=تیپتیپ+افن
IoU =Iپ∩ IجیIپ∪ Iجی=تیپتیپافپافنIoU=آر�منپ∩آر�منجیآر�منپ∪آر�منجی=تیپتیپ+افپ+افن
۱ =۲ × دقت × فراخواندقت یادآوریاف۱=۲×دقت، درستی×به خاطر آوردندقت، درستی+به خاطر آوردن
AP =P0.50 P0.55 … P0.9510AP=آپ۰٫۵۰+آپ۰٫۵۵+…+آپ۰٫۹۵۱۰

که در آن TP ، FP ، TN ، و FN به ترتیب پیکسل های مثبت واقعی، مثبت کاذب، منفی درست و منفی کاذب را نشان می دهند. امتیاز F1 برای مبادله فراخوانی و دقت برای نشان دادن عملکرد کلی مدل آموزش دیده استفاده می شود و AP برای نشان دادن عملکرد کلی مدل تحت آستانه های اطمینان مختلف استفاده می شود.

بر اساس شاخص‌های ارزیابی بالا، ما یک معیار ارزیابی جدید را پیشنهاد می‌کنیم تا قضاوت کنیم که آیا چارچوب پیش‌بینی فعلی با محدود کردن حداقل مقدار ناحیه همپوشانی با مقدار واقعی، معیارهای تشخیص کار واقعی را برآورده می‌کند یا خیر. در کار تشخیص تابلوی فروشگاه واقعی، اگر دقت طبق استاندارد ارزیابی تشخیص هدف موجود محاسبه شود، یعنی دقت با توجه به پیکسل های همپوشانی بدون محدودیت محاسبه شود، با پیش بینی واقعی مطابقت ندارد. به عنوان مثال، اگر چارچوب پیش‌بینی فقط ۵۰ تا ۶۰ درصد با مقدار واقعی همپوشانی داشته باشد [ ۵۸]، پس نباید این چارچوب پیش بینی را در کار واقعی به عنوان صحیح طبقه بندی کنیم. بنابراین، با محدود کردن ناحیه همپوشانی بین قاب پیش‌بینی و مقدار واقعی طبق مقررات دپارتمان مربوطه، درست بودن یا نبودن چارچوب پیش‌بینی فعلی را تعیین می‌کنیم.

اساتحادیه S∩ Sتو ای _اساتحاد. اتصال=اسپ�ه∩استی�توه
اسnاسetاستو�من��اسپ�ه>تی
اسnاستو ای _tاستو�من��استی�توه>تی

که در آن pre ناحیه همپوشانی است، pre ناحیه پیش بینی، true ناحیه زمین-حقیقت است، و t آستانه دو نسبت است (یکی منطقه همپوشانی به ناحیه پیش بینی، و دیگری منطقه همپوشانی به منطقه حقیقت زمین). مقدار آستانه را روی ۰٫۸ قرار دادیم که برای تعیین صحیح قاب پیش‌بینی فعلی استفاده شد. چنین معیار ارزیابی از یک طرف دقت تشخیص تابلوهای فروشگاهی را تضمین می کند و از طرف دیگر شباهت چارچوب پیش بینی به مقدار واقعی را کاملاً در نظر می گیرد که در اصل منطقی تر است.

۳٫۱٫۴٫ انتخاب روش مقایسه
برای نشان دادن اثربخشی روش پیشنهادی برای تشخیص تابلوهای فروشگاه، روش را روی مجموعه داده CTW خود برچسب‌گذاری شده و مجموعه داده نمای خیابان Baidu خود برچسب‌گذاری شده ارزیابی کردیم و آن را به صورت کمی با روش‌های مورد استفاده در [ ۳۹ ]، EfficientDet_d0 مقایسه کردیم. [ ۵۹ ]، R-CNN_resnet50 سریعتر [ ۶۰ ]، YOLOX_s [ ۶۱ ]، YOLOv4 [ ۶۲ ] و YOLOv5_l. مطالعه یوان و همکاران. [ ۵۶ ] متن روی تابلوهای فروشگاهی را هدف گرفته بود که با موضوع تحقیق ما سازگاری ندارد. مطالعه لیو و همکاران. [ ۶۳] با هدف تابلوهای تبلیغاتی غیرقانونی در معابر و وسط پیاده رو بود، بنابراین باز هم تفاوت اساسی بین این دو کار وجود دارد. بنابراین، روش های ارائه شده در این دو مقاله نمی توانند به عنوان روش های تجربی مقایسه ای مورد استفاده قرار گیرند. در مطالعه موررا و همکاران. [ ۳۹ ]، SSD [ ۵۱ ] و YOLOv3 [ ۶۴ ] به عنوان روش های مقایسه مورد استفاده قرار گرفتند، بنابراین این دو الگوریتم برای مقایسه تجربی در این مقاله انتخاب شدند. روش‌های مقایسه شامل طبقه‌بندی‌کننده‌های یک‌مرحله‌ای و طبقه‌بندی‌کننده دو مرحله‌ای، و همچنین چندین نسخه از خانواده you only look one (YOLO) بود. YOLOv5_l اساس مدل بهبود یافته ارائه شده در این مقاله است.

۳٫۲٫ نتایج تجربی و تجزیه و تحلیل

۳٫۲٫۱٫ نتایج تجربی تطبیقی ​​و تجزیه و تحلیل

نتایج ارزیابی کمی در جدول ۲ و جدول ۳ فهرست شده است. بهترین نتایج با خط پررنگ مشخص شده و دومین نتایج برتر زیر آنها خط کشیده شده است.
جدول ۲ نشان می دهد که روش پیشنهادی بالاترین امتیازات را برای هر پنج معیار در مجموعه داده CTW خود برچسب دار به دست می آورد، که نشان می دهد الگوریتم پیشنهادی می تواند تعادل بین دقت و یادآوری را حفظ کند. نمرات دقت و یادآوری مربوطه به ترتیب ۸۲٫۷% و ۸۷٫۶% می باشد که نشان می دهد ۸۲٫۷% از عناصر شناسایی شده تابلوهای فروشگاه در تصاویر آزمایشی هستند و ۸۷٫۶% از کل عناصر تابلوی فروشگاه در تصاویر به درستی شناسایی شده اند. امتیاز F1 روش پیشنهادی ۸۲٫۴ درصد است که ۶٫۰-۳۳٫۸ درصد بیشتر از روش های دیگر است که نشان دهنده برتری روش پیشنهادی است. IoU روش پیشنهادی ۷۸٫۱ درصد است که ۱۶٫۳ درصد بیشتر از YOLOv5_l رتبه دوم است. نتایج کمی نشان می‌دهد که روش‌های YOLOv3 و SSD شرح داده شده در [ ۳۹] نمی تواند وظیفه تشخیص این مقاله را تکمیل کند. علاوه بر این، روش بهبودیافته ما در مقایسه با YOLOv5_l اصلی، نرخ فراخوان را تا ۷٫۵ درصد و دقت را ۱٫۹ درصد بهبود می‌بخشد، که نشان می‌دهد تابلوهای راهنمای فروشگاه‌های بیشتری در نتایج روش ما نسبت به روش اصلی YOLOv5_l با موفقیت شناسایی شدند.
برای آزمایش بیشتر عملکرد مدل پیشنهادی تحت منابع داده‌های مختلف، آزمایش‌هایی را نیز بر روی مجموعه داده نمای خیابان بایدو انجام دادیم. مجموعه داده مشروح Baidu شامل ۳۰۰ تصویر نمای خیابان بود و مانند مجموعه داده CTW، شامل صحنه‌هایی با پیچیدگی‌های مختلف بود، با این تفاوت که اندازه‌های تصویر متفاوت بود. از جدول ۳ ، مشخص است که روش پیشنهادی از نظر دقت، یادآوری، امتیاز F1، IoU و AP در رتبه اول قرار دارد. امتیاز AP ​​روش پیشنهادی ۱۶٫۴-۳۰٫۰ درصد بیشتر از روش های دیگر است و IoU 10.7-34.6 درصد بیشتر از روش های دیگر است. امتیاز کلی YOLOv5_l پایین است، اما دقت روش‌های YOLOv3 و SSD مورد استفاده در [ ۳۹] نیز در مجموعه داده جدید کاهش می یابد، که نشان می دهد ما توانایی تعمیم مدل را بهبود بخشیده ایم.
شکل ۱۲ چهار نتیجه بصری را برای روش‌های آزمایش شده در مجموعه داده CTW خود برچسب‌گذاری شده نشان می‌دهد، از جمله صحنه‌هایی با شرایط نوری مختلف و سطوح انسداد متفاوت. حدود ۰٫۲۲ ثانیه طول کشید تا با استفاده از OSO-YOLOv5 پیشنهادی، ۲۰۴۸ × ۲۰۴۸ پیکسل برای هر تصویر آزمایشی استنتاج شود. کل تصویر دارای نه سطر و چهار ستون است. ستون ها تصاویر چهار نمونه معرف از مجموعه داده آزمایشی و نتایج تشخیص روش های مختلف هستند. سطرها حاوی تصاویر برچسب‌گذاری شده و نقشه‌های پیش‌بینی تولید شده توسط هشت روش تست هستند. کادر زرد رنگ در هر یک از این تصاویر یک ناحیه بزرگنمایی شده محلی را نشان می دهد.
همانطور که در شکل ۱۲ مشاهده می شود ، بزرگترین مشکل برای تشخیص خودکار در مجموعه داده CTW این است که تابلوهای فروشگاه در تصاویر توسط درختان پوشیده شده و در نتیجه مرزهای تار یا حتی غیرقابل مشاهده ایجاد می شود. در مقایسه با سایر روش های آزمایش شده، الگوریتم پیشنهادی کمتر تحت تأثیر قرار می گیرد. در شکل ۱۲ ، ستون اول پلات، تابلوهای فروشگاهی در مقیاس بزرگ را بدون انسداد نشان می دهد، و ستون های دوم تا چهارم، تابلوهای فروشگاه را با درجات انسداد فزاینده نشان می دهد، یعنی استخراج خودکار آنها روز به روز دشوارتر است. برای تابلوهای فروشگاهی در مقیاس بزرگ بدون مانع نشان داده شده در ستون اول شکل، روش ما، دو روش مورد استفاده در [ ۳۹]، و چهار روش دیگر می توانند نتایج استخراج کامل را به دست آورند، به جز YOLOv5. با این حال، این روش ها در مورد انسداد عملکرد متفاوتی دارند. همانطور که از نمودار ستون دوم مشاهده می شود، تنها روش پیشنهادی، EfficientDet و YOLOX می توانند تابلوهای فروشگاه در مقیاس کوچک و نیمه مسدود شده را استخراج کنند، اما مرزهای استخراج شده توسط EfficientDet و YOLOX چندان دقیق نیستند. برای تابلوهای فروشگاهی به شدت مسدود شده نشان داده شده در نمودارهای ستون سوم و چهارم، نتایج استخراج شده از روش پیشنهادی در مقایسه با سایر الگوریتم‌های آزمایش‌شده، مطابقت بیشتری با مناطق تابلوی فروشگاه واقعی در تصاویر دارد، که نشان می‌دهد تابلوی فروشگاه OSO-YOLOv5 شبکه استخراج پیشنهاد شده در این مقاله می‌تواند به طور موثری دقت تشخیص را بهبود بخشد و تأثیر انسداد را بر استخراج تابلوهای فروشگاه از بین ببرد.۳۹ ] برای تشخیص علائم ایستگاه اتوبوس خوب هستند، اما برای تابلوهای فروشگاهی که در این مقاله مورد بررسی قرار گرفته اند، چندان خوب نیستند. به طور کلی، می‌توان نتیجه گرفت که روش پیشنهادی می‌تواند اطلاعات چند مقیاسی را درک کند، قسمت‌های مسدود شده را از طریق اطلاعات متنی استنتاج کند و دقت تشخیص بالاتری را به دست آورد.
۳٫۲٫۲٫ نتایج و تجزیه و تحلیل برای آزمایش های ابلیشن
آزمایش‌های مقایسه‌ای اثربخشی روش پیشنهادی را در شرایط پیچیده مانند تابلوهای فروشگاه در شرایط انسداد سایه/درخت و تابلوهای فروشگاه چند مقیاسی نشان دادند. در مقایسه با الگوریتم اصلی YOLOv5_l، روش پیشنهادی امتیاز F1 را ۶٫۰٪ و IoU را ۱۶٫۳٪ در مجموعه داده CTW بهبود می بخشد. از آنجایی که چارچوب طراحی شده یک چارچوب چندوظیفه ای است، بهینه سازی ماژول های فردی لزوماً بهبود عملکرد مدل را تضمین نمی کند. بنابراین، ما آزمایش‌های فرسایشی گسترده‌ای را برای بررسی تأثیر هر یک از ماژول‌های روش پیشنهادی انجام دادیم. ما همچنین پیشرفت‌های حاصل از ترکیب همه ماژول‌ها را نشان می‌دهیم تا نشان دهیم که این اجزای ترکیبی همه مکمل یکدیگر هستند.
مجموعه داده ها و شاخص های ارزیابی انتخاب شده برای آزمایش های شرح داده شده در این بخش مانند بخش ۳٫۲٫۱ است. نتایج ارزیابی کمی در شکل ۱۳ نشان داده شده است.
همانطور که از شکل ۱۳ مشاهده می شودa،b، هر خط یک معیار ارزیابی را نشان می دهد، و دقت، یادآوری، امتیاز F1 و IoU به طور کلی روند افزایشی را با اضافه شدن ماژول های مختلف نشان می دهد. از مشاهدات عمودی در شکل، می‌توان به وضوح مشاهده کرد که روش ادغام همه ماژول‌ها بالاترین امتیاز را در هر چهار معیار به دست می‌آورد. بر این اساس، می‌توان نتیجه گرفت که ادغام ماژول‌های مختلف منجر به بهبود خاصی در دقت تشخیص می‌شود، اما ترکیب همه ماژول‌ها منجر به بالاترین دقت تشخیص می‌شود. معرفی یک ماژول منفرد منجر به درجات مختلف بهبود در مقادیر دقت یا یادآوری می شود. این یافته‌ها برای نشان دادن این نکته کافی است که ماژول‌های مختلف استخراج ویژگی‌های مستطیلی چند مقیاسی در وسط تصاویر را بهبود می‌بخشند و مشکل تکه تکه شدن هدف را حل می‌کنند. تا حدی این نتایج همچنین نشان می‌دهد که اجزا مکمل یکدیگر هستند و عملکرد YOLOv5_l اصلی را از دیدگاه‌های مختلف بهبود می‌بخشند.

۴٫ نتیجه گیری

با عناصر زیاد، ساختارهای پیچیده و تغییرات پویا در سیستم‌های شهری، استخراج سریع و دقیق تابلوهای فروشگاهی از تصاویر نمای خیابان به یک نقطه تحقیقاتی کلیدی برای مدیریت هوشمند اجزای شهری تبدیل شده است. استخراج نادرست اطلاعات تابلوی فروشگاه مشکل اصلی روش های اصلی تشخیص هدف است. در این مطالعه، ما به طور کامل ویژگی‌های هر نوع تابلوی فروشگاهی را در نظر گرفتیم، از تداخل متقابل بین انواع تابلوهای فروشگاهی جلوگیری کردیم، آموزش مدل تولید و استخراج نمونه را بسیار دشوارتر کردیم، و سپس یک محدودیت ویژگی مستطیلی، یکپارچه‌سازی مکان را پیشنهاد کردیم. توجه و بازسازی توپولوژی در شبکه OSO-YOLOv5، برای حل مشکل تشخیص هوشمند تابلوهای فروشگاه در صحنه های پیچیده واقعی.
این چارچوب، گردش کار چند مرحله‌ای سنتی را به یک معماری یادگیری عمیق پایان به انتها برای نظارت نیمه خودکار بر اجزای شهری تبدیل می‌کند. گردش کار کلی روش پیشنهادی بر اساس ساختار اصلی ستون فقرات + گردن YOLOv5 است. ستون فقرات بهبود یافته برای بهبود درک ویژگی‌های مستطیلی چند مقیاسی و درک مختصات استفاده می‌شود، و همچنین ساختار روابط توپولوژیکی را افزایش می‌دهد. گردن بهبود یافته برای افزایش قابلیت بیان ویژگی استفاده می شود. در زمینه ساخت شهر هوشمند، ما معتقدیم که این روش پتانسیل زیادی برای کاربرد در نقشه برداری و به روز رسانی سناریوها خواهد داشت. ما همچنین معتقدیم که این تحقیق گلوگاه فنی تشخیص اطلاعات شهری را می شکند، و می تواند برای ارتقای توسعه با کیفیت بالا شهرها مورد استفاده قرار گیرد. به طور خاص، این مطالعه را می توان به کشف بیلبوردهای غیرقانونی تعمیم داد. همچنین هدف ما این است که روی تطبیق نام مکان ها و آدرس ها کار بیشتری انجام دهیم. تابلوهای راهنما شناسایی شده در این تحقیق را می توان به عنوان داده های POI در نظر گرفت و هنگامی که با فناوری OCR ترکیب می شود، می توان از این اطلاعات برای اختصاص ویژگی های مربوط به نام فروشگاه به هر نقطه مورد علاقه استفاده کرد تا تطابق نام مکان ها و آدرس ها را درک کند.
ما تصاویر نمای خیابان را در مجموعه داده عمومی CTW غربال کردیم، مدل را آموزش دادیم و سپس توانایی تعمیم مدل را با تصاویر نمای خیابان از منبع داده بایدو آزمایش کردیم. نتایج ارزیابی کمی به‌دست‌آمده در هر دو مجموعه داده نشان داد که روش پیشنهادی از دقت بالاتری برخوردار است. روش پیشنهادی همچنین دقت محلی سازی بالاتری را در مورد توزیع متمرکز و آرایش فشرده اهداف نشان داد. این روش همچنین می تواند عملکرد را در موارد پیچیده ای که اهداف دارای تنوع مقیاس هستند یا مسدود شده اند، بیشتر بهبود بخشد. در واقع محدودیت‌هایی برای این تحقیق وجود دارد، مانند: (۱) الگوریتم فعلی به دستگاه نسبتاً سطح بالایی نیاز دارد، بنابراین ما نیاز به توسعه یک مدل سبک وزن داریم که بتواند مستقیماً روی تلفن همراه مستقر شود. (۲) الگوریتم باید در مورد یک پس‌زمینه یکنواخت و طرح‌بندی تابلوی فروشگاه بدون مرز، که یک «چشم‌انداز چینی» معمولی است، بیشتر بررسی شود. (۳) الگوریتم فعلی تأثیر خوبی در تشخیص تابلوهای فروشگاه در نمای جلویی دارد، اما دقت تشخیص تابلوهای فروشگاه در تصاویر گرفته شده با زاویه رضایت بخش نیست.
در کار آینده خود، قصد داریم چارچوب را از طریق جنبه های زیر بهبود دهیم: (۱) معرفی مدل های سبک وزن به ستون فقرات یا ماژول تشخیص. (۲) بهینه سازی بیشتر یادگیری بومی سازی، مانند طراحی تابع از دست دادن مرزی جدید. و (۳) معرفی اطلاعات ذخیره بیشتر و ایجاد یک نمودار دانش، که در نهایت با ترکیب تکنیک های تشخیص شی در بینایی کامپیوتر با یک نمودار دانش، به دقت تشخیص بهبود یافته ای دست خواهد یافت.

منابع

  1. لیو، جی. تحقیق در مورد اندازه‌گیری سطح ساخت و ساز و استراتژی توسعه شهر هوشمند Yiyang بر اساس تجزیه و تحلیل مؤلفه‌های اصلی. در مجموعه مقالات کنفرانس بین المللی ۲۰۲۰ حمل و نقل هوشمند، داده های بزرگ و شهر هوشمند (ICITBS)، وینتیان، لائوس، ۱۱ تا ۱۲ ژانویه ۲۰۲۰؛ صص ۱۷۶-۱۸۰٫ [ Google Scholar ]
  2. آنگلوف، دی. دولونگ، سی. فیلیپ، دی. فروه، سی. لافون، اس. لیون، آر. اوگل، ا. وینسنت، ال. ویور، جی. نمای خیابان گوگل: ثبت جهان در سطح خیابان. کامپیوتر ۲۰۱۰ ، ۴۳ ، ۳۲-۳۸٫ [ Google Scholar ] [ CrossRef ]
  3. بلالی، وی. گل پرور فرد، م. تقسیم بندی و شناسایی دارایی های جاده از جریان های ویدئویی دوربین سوار بر خودرو با استفاده از روش تجزیه ناپارامتریک تصویر مقیاس پذیر. خودکار ساخت و ساز ۲۰۱۵ ، ۴۹ ، ۲۷-۳۹٫ [ Google Scholar ] [ CrossRef ]
  4. کمبل، ای. هر دو، A. Sun، Q. تشخیص و نقشه‌برداری علائم ترافیکی از تصاویر نمای خیابان Google با استفاده از یادگیری عمیق و GIS. محاسبه کنید. محیط زیست سیستم شهری ۲۰۱۹ ، ۷۷ ، ۱۰۱۳۵۰٫ [ Google Scholar ] [ CrossRef ]
  5. زوند، دی. Bettencourt, L. تصویربرداری نمای خیابان برای ارزیابی خودکار زیرساخت‌ها و خدمات شهری. در انفورماتیک شهری ; Shi, W., Goodchild, M., Batty, M., Kwan, M., Zhang, A., Eds. اسپرینگر: سنگاپور، ۲۰۲۱؛ ص ۲۹-۴۰٫ [ Google Scholar ]
  6. لو، اچ. یانگ، ی. تانگ، بی. وو، اف. فن، ب. تشخیص علائم ترافیکی با استفاده از یک شبکه عصبی کانولوشن چند وظیفه ای. IEEE Trans. هوشمند ترانسپ سیستم ۲۰۱۸ ، ۱۹ ، ۱۱۰۰–۱۱۱۱٫ [ Google Scholar ] [ CrossRef ]
  7. ژو، ال. شی، ی. ژنگ، جی. شناسایی حلقه تجاری و ویژگی‌های فضایی-زمانی در منطقه شهری اصلی شهر Yiwu بر اساس داده‌های POI و نور شبانه. Remote Sens. ۲۰۲۱ , ۱۳ , ۵۱۵۳٫ [ Google Scholar ] [ CrossRef ]
  8. سویلان، ام. ریویرو، بی. مارتینز-سانچز، جی. آریاس، ص. تشخیص علائم ترافیکی در MLS ابرهای نقطه‌ای را برای موجودی معنایی هندسی و مبتنی بر تصویر به دست آورد. ISPRS J. Photogramm. Remote Sens. ۲۰۱۶ ، ۱۱۴ ، ۹۲-۱۰۱٫ [ Google Scholar ] [ CrossRef ]
  9. معبودی، م. امینی، ج. هان، م. ساعتی، م. استخراج شبکه جاده از تصاویر ماهواره ای VHR با استفاده از یکپارچه سازی ویژگی شی آگاه از زمینه و رای گیری تانسور. Remote Sens. ۲۰۱۶ , ۸ , ۶۳۷٫ [ Google Scholar ] [ CrossRef ]
  10. پاتیل، م. دسای، سی. Umrikar، B. ابزار طبقه بندی تصویر برای تحلیل کاربری زمین/پوشش زمین: مطالعه مقایسه ای روش حداکثر احتمال و حداقل فاصله. بین المللی جی. جئول. محیط زمین. علمی (JGEE) ۲۰۱۲ ، ۲ ، ۱۸۹-۱۹۶٫ [ Google Scholar ]
  11. ژائو، کیو. جیا، اس. Li، Y. طبقه بندی تصویر سنجش از دور فراطیفی بر اساس طرح ریزی تصادفی دقیق تر با حداقل الگوریتم واریانس درون کلاسی. تشخیص الگو ۲۰۲۱ ، ۱۱۱ ، ۱۰۷۶۳۵٫ [ Google Scholar ] [ CrossRef ]
  12. یانگ، جی. گائو، دبلیو. دوان، ایکس. Hu, Y. استخراج اطلاعات ساختمان بر اساس انتخاب خودکار ویژگی شی گرا. Remote Sens. Inf. ۲۰۲۰ ، ۳۶ ، ۱۳۰-۱۳۵٫ [ Google Scholar ]
  13. چن، سی. یو، جی. لینگ، Q. بلوک توجه پراکنده: جمع آوری اطلاعات زمینه ای برای تشخیص شی. تشخیص الگو ۲۰۲۲ ، ۱۲۴ ، ۱۰۸۴۱۸٫ [ Google Scholar ] [ CrossRef ]
  14. شهریاری، س. همیلتون، سی. طبقه بندی علائم ترافیکی مبتنی بر شبکه عصبی POMDP تحت شرایط آب و هوایی. در مجموعه مقالات بیست و نهمین کنفرانس کانادایی هوش مصنوعی، هوش مصنوعی کانادا ۲۰۱۶، ویکتوریا، BC، کانادا، ۳۱ مه تا ۳ ژوئن ۲۰۱۶؛ ص ۱۲۲-۱۲۷٫ [ Google Scholar ]
  15. ولی، SB; عبدالله، م. هانان، MA; حسین، ع. صمد، س. Ker, PJ; Bin Mansor, M. Vision-based Traffic Sign Detection and Recognition Systems: Current Trends and Challenges. Sensors ۲۰۱۹ , ۱۹ , ۲۰۹۳٫ [ Google Scholar ] [ CrossRef ] [ PubMed ]
  16. لی، اچ. سان، اف. لیو، ال. وانگ، ال. یک روش جدید تشخیص علائم راهنمایی و رانندگی از طریق تقسیم بندی رنگ و تطبیق شکل قوی. محاسبات عصبی ۲۰۱۵ ، ۱۶۹ ، ۷۷-۸۸٫ [ Google Scholar ] [ CrossRef ]
  17. Fleyeh, H. Shadow and Highlight Invariant Color Segmentation الگوریتم برای علائم راهنمایی و رانندگی. در مجموعه مقالات کنفرانس IEEE 2006 در مورد سایبرنتیک و سیستم های هوشمند، تایپه، تایوان، ۷-۹ ژوئن ۲۰۰۶٫ صص ۱-۷٫ [ Google Scholar ]
  18. فرهت، دبلیو. فیض، ح. سوانی، سی. Besbes، K. سیستم جاسازی شده در زمان واقعی برای تشخیص علائم راهنمایی و رانندگی بر اساس ZedBoard. J. فرآیند تصویر در زمان واقعی. ۲۰۱۹ ، ۱۶ ، ۱۸۱۳-۱۸۲۳٫ [ Google Scholar ] [ CrossRef ]
  19. لیو، سی. لی، اس. چانگ، اف. Wang, Y. روش‌های تشخیص علائم ترافیکی مبتنی بر دید ماشینی: بررسی، تجزیه و تحلیل و دیدگاه‌ها. دسترسی IEEE ۲۰۱۹ ، ۷ ، ۸۶۵۷۸–۸۶۵۹۶٫ [ Google Scholar ] [ CrossRef ]
  20. کریژفسکی، آ. سوتسکور، آی. هینتون، GE ImageNet طبقه بندی با شبکه های عصبی کانولوشن عمیق. اشتراک. ACM ۲۰۱۷ ، ۶۰ ، ۸۴–۹۰٫ [ Google Scholar ] [ CrossRef ]
  21. برونی-بدیاکو، سی. موراتا، ی. مورمیل، LHB؛ Atsumi، M. جستجو برای معماری CNN برای طبقه بندی صحنه سنجش از دور. IEEE Trans. Geosci. Remote Sens. ۲۰۲۲ , ۶۰ , ۱-۱۳٫ [ Google Scholar ] [ CrossRef ]
  22. دونگ، ز. وانگ، ام. وانگ، ی. زو، ی. Zhang، Z. تشخیص شیء در تصاویر سنجش از دور با وضوح بالا بر اساس شبکه‌های عصبی کانولوشن با ویژگی‌های مقیاس شی مناسب. IEEE Trans. Geosci. Remote Sens. ۲۰۲۰ , ۵۸ , ۲۱۰۴–۲۱۱۴٫ [ Google Scholar ] [ CrossRef ]
  23. حق، م. رحمان، جی. بارال، پ. Ghosh, A. طبقه بندی تصویر نظارت شده مبتنی بر یادگیری عمیق با استفاده از تصاویر پهپاد برای طبقه بندی مناطق جنگلی. J. شرکت هندی Remote Sens. ۲۰۲۱ , ۴۹ , ۶۰۱–۶۰۶٫ [ Google Scholar ] [ CrossRef ]
  24. زو، XX; تویا، دی. مو، ال. Xia، G.-S. ژانگ، ال. خو، اف. Fraundorfer، F. یادگیری عمیق در سنجش از دور: بررسی جامع و فهرست منابع. IEEE Geosci. سنسور از راه دور Mag. ۲۰۱۷ ، ۵ ، ۸-۳۶٫ [ Google Scholar ] [ CrossRef ]
  25. چنگ، جی. یانگ، سی. یائو، ایکس. گوا، ال. Han, J. When Deep Learning Meets Metric Learning: Remote Sensing Image Scene Classification by Learning Discriminative CNNs. IEEE Trans. Geosci. Remote Sens. ۲۰۱۸ , ۵۶ , ۲۸۱۱–۲۸۲۱٫ [ Google Scholar ] [ CrossRef ]
  26. لانگ، جی. شلهامر، ای. دارل، تی. شبکه های کاملاً پیچیده برای تقسیم بندی معنایی. در مجموعه مقالات کنفرانس IEEE 2015 در مورد بینایی کامپیوتری و تشخیص الگو (CVPR)، بوستون، MA، ایالات متحده آمریکا، ۷ تا ۱۲ ژوئن ۲۰۱۵؛ صص ۳۴۳۱–۳۴۴۰٫ [ Google Scholar ]
  27. هان، ایکس. لو، جی. ژائو، سی. لی، اچ. شبکه‌های عصبی کاملاً پیچیده برای تشخیص جاده با ادغام نشانه‌های چندگانه. در مجموعه مقالات کنفرانس بین المللی IEEE 2018 در مورد رباتیک و اتوماسیون (ICRA)، بریزبن، QLD، استرالیا، ۲۱ تا ۲۵ مه ۲۰۱۸؛ صص ۴۶۰۸-۴۶۱۳٫ [ Google Scholar ]
  28. ژانگ، پی. لیو، دبلیو. لی، ی. وانگ، اچ. مجموعه سطح چندفاز عمیق Lu, H. برای تجزیه صحنه. IEEE Trans. فرآیند تصویر ۲۰۲۰ ، ۲۹ ، ۴۵۵۶-۴۵۶۷٫ [ Google Scholar ] [ CrossRef ]
  29. چن، ال. پاپاندرو، جی. شروف، اف. Adam, H. Rethinking Convolution Atrous for Semantic Image Segmentation. arXiv ۲۰۱۷ ، arXiv:1706.05587v3. [ Google Scholar ]
  30. چنگ، بی. کالینز، MD؛ زو، ی. لیو، تی. هوانگ، تی اس؛ آدم، اچ. Chen, LC Panoptic-DeepLab: یک پایه ساده، قوی و سریع برای تقسیم بندی پانوپتیک از پایین به بالا. در مجموعه مقالات کنفرانس IEEE/CVF 2020 در مورد دید رایانه و تشخیص الگو (CVPR)، سیاتل، WA، ایالات متحده آمریکا، ۱۳ تا ۱۹ ژوئن ۲۰۲۰؛ ص ۱۲۴۷۲–۱۲۴۸۲٫ [ Google Scholar ]
  31. لی، ز. چن، ایکس. جیانگ، جی. هان، ز. لی، ز. نیش، تی. هوو، اچ. لی، کیو. لیو، ام. ساختار چند مقیاسی آبشاری با پیچش آتروس خود هموار برای تقسیم بندی معنایی. IEEE Trans. Geosci. Remote Sens. ۲۰۲۲ , ۶۰ , ۱-۱۳٫ [ Google Scholar ] [ CrossRef ]
  32. رونبرگر، او. فیشر، پی. Brox، T. U-Net: شبکه های کانولوشن برای تقسیم بندی تصویر زیست پزشکی. در مجموعه مقالات محاسبات تصویر پزشکی و مداخله به کمک کامپیوتر-MICCAI 2015، مونیخ، آلمان، ۵ تا ۹ اکتبر ۲۰۱۵٫ صص ۲۳۴-۲۴۱٫ [ Google Scholar ]
  33. ژانگ، ز. لیو، کیو. وانگ، Y. استخراج جاده توسط Deep Residual U-Net. IEEE Geosci. سنسور از راه دور Lett. ۲۰۱۸ ، ۱۵ ، ۷۴۹-۷۵۳٫ [ Google Scholar ] [ CrossRef ]
  34. دیاکوگیانیس، فی. والدنر، اف. کاکتا، پی. Wu, C. ResUNet-a: یک چارچوب یادگیری عمیق برای تقسیم بندی معنایی داده های سنجش از راه دور. ISPRS J. Photogramm. Remote Sens. ۲۰۲۰ , ۱۶۲ , ۹۴–۱۱۴٫ [ Google Scholar ] [ CrossRef ]
  35. ژائو، دبلیو. پرسلو، سی. Stein، A. ترسیم طرح کلی ساختمان: از تصاویر هوایی تا چند ضلعی با چارچوب یادگیری سرتاسر بهبود یافته. ISPRS J. Photogramm. Remote Sens. ۲۰۲۱ , ۱۷۵ , ۱۱۹–۱۳۱٫ [ Google Scholar ] [ CrossRef ]
  36. حصاری، م. دیو، اس. نیکلسون، ام. مک کیب، ک. ناوتیال، ا. کنران، سی. تانگ، جی. خو، دبلیو. Pitié، F. ADNet: شبکه ای عمیق برای تشخیص تبلیغات. arXiv ۲۰۱۸ ، arXiv:1811.04115v1. [ Google Scholar ]
  37. دیو، اس. حصاری، م. نیکلسون، ام. مک کیب، ک. ناوتیال، ا. کنران، سی. تانگ، جی. مجموعه داده CASE فضاهای کاندیدا برای کاشت آگهی. در مجموعه مقالات شانزدهمین کنفرانس بین المللی ۲۰۱۹ در مورد کاربردهای بینایی ماشین (MVA)، توکیو، ژاپن، ۲۷ تا ۳۱ مه ۲۰۱۹؛ صص ۱-۴٫ [ Google Scholar ]
  38. خو، X. ممکن است.؛ کیان، ایکس. Zhang, Y. Scale-aware Efficient Det: الگوریتم تشخیص عابر پیاده در زمان واقعی برای رانندگی خودکار. J. نمودار تصویر. ۲۰۲۱ ، ۲۶ ، ۹۳-۱۰۰٫ [ Google Scholar ] [ CrossRef ]
  39. موررا، ا. سانچز، آ. مورنو، AB; ساپا، ا. Vélez، J. SSD در مقابل YOLO برای تشخیص پانل های تبلیغات شهری در فضای باز تحت متغیرهای چندگانه. Sensors ۲۰۲۰ , ۲۰ , ۴۵۸۷٫ [ Google Scholar ] [ CrossRef ]
  40. وانگ، جی. ژوانگ، ی. چن، اچ. لیو، ایکس. ژانگ، تی. لی، ال. دونگ، اس. سانگ، Q. FSoD-Net: تشخیص اشیاء در مقیاس کامل از تصاویر سنجش از راه دور نوری. IEEE Trans. Geosci. Remote Sens. ۲۰۲۲ ، ۶۰ ، ۱-۱۸٫ [ Google Scholar ] [ CrossRef ]
  41. متعجب.؛ وانگ، ال. ژانگ، ام. دینگ، ی. Zhu, Q. بازسازی سریع و منظم نماهای ساختمان از تصاویر نمای خیابان با استفاده از برنامه نویسی عدد صحیح باینری. arXiv ۲۰۲۰ ، arXiv:2002.08549v3. [ Google Scholar ] [ CrossRef ]
  42. لی، جی. هونگ، جی. پارک، جی. کیم، اچ اس. لی، اس. Seo, T. شناسایی نمای آلوده با استفاده از شبکه عصبی کانولوشنال و پردازش تصویر. دسترسی IEEE ۲۰۲۰ ، ۸ ، ۱۸۰۰۱۰–۱۸۰۰۲۱٫ [ Google Scholar ] [ CrossRef ]
  43. وو، دبلیو. یین، ی. وانگ، ایکس. Xu, D. تشخیص چهره با مقیاس های مختلف بر اساس سریعتر R-CNN. IEEE Trans. سایبرن. ۲۰۱۹ ، ۴۹ ، ۴۰۱۷–۴۰۲۸٫ [ Google Scholar ] [ CrossRef ] [ PubMed ]
  44. لیو، دبلیو. وو، زی. لو، جی. سان، ی. وو، تی. ژو، ن. هو، ایکس. وانگ، ال. Zhou، Z. یک روش استخراج تقسیم شده و طبقه بندی شده اطلاعات سنجش از دور با وضوح بالا برای زمین های زراعی در مناطق تپه ای و کوهستانی بر اساس یادگیری عمیق. Acta Geod. کارتوگر. گناه ۲۰۲۱ ، ۵۰ ، ۱۰۵-۱۱۶٫ [ Google Scholar ] [ CrossRef ]
  45. Ultralytics Yolov5. در دسترس آنلاین: https://github.com/ultralytics/yolov5 (در ۱۸ مه ۲۰۲۰ قابل دسترسی است).
  46. اورتاسون، ر. متقی، ر. لیو، ایکس. چو، N.-g. لی، اس.-و. نقش زمینه برای تشخیص شی و تقسیم بندی معنایی در طبیعت. در مجموعه مقالات کنفرانس IEEE 2014 در مورد بینایی کامپیوتری و تشخیص الگو (CVPR)، کلمبوس، OH، ایالات متحده آمریکا، ۲۳ تا ۲۸ ژوئن ۲۰۱۴٫ صص ۸۹۱-۸۹۸٫ [ Google Scholar ]
  47. لیو، آر. لمن، جی. مولینو، پی. پتروسکی ساچ، ف. فرانک، ای. سرگیف، آ. یوسینسکی، جی. شکست جالب شبکه های عصبی کانولوشن و راه حل CoordConv. arXiv ۲۰۱۸ ، arXiv:1807.03247v2. [ Google Scholar ]
  48. هو، کیو. ژانگ، ال. چنگ، MM; Feng, J. Strip Pooling: Rethinking Spatial Pooling for Scene Parsing. در مجموعه مقالات کنفرانس IEEE/CVF 2020 در مورد دید رایانه و تشخیص الگو (CVPR)، سیاتل، WA، ایالات متحده آمریکا، ۱۳ تا ۱۹ ژوئن ۲۰۲۰؛ صفحات ۴۰۰۲-۴۰۱۱٫ [ Google Scholar ]
  49. بلو، آی. زوف، بی. لی، کیو. واسوانی، ع. Shlens, J. توجه شبکه های کانولوشنال تقویت شده. در مجموعه مقالات کنفرانس بین المللی IEEE/CVF 2019 در بینایی کامپیوتر (ICCV)، سیاتل، WA، ایالات متحده آمریکا، ۲۷ اکتبر تا ۲ نوامبر ۲۰۱۹؛ صص ۳۲۸۵-۳۲۹۴٫ [ Google Scholar ]
  50. ژانگ، اچ. زو، ک. لو، جی. زو، ی. Meng, D. EPSANet: بلوک توجه فشرده هرم کارآمد در شبکه عصبی کانولوشن. arXiv ۲۰۲۱ ، arXiv:2105.14447v2. [ Google Scholar ]
  51. لیو، دبلیو. آنگلوف، دی. ایرهان، د. سگدی، سی. رید، اس. فو، سی. Berg، AC SSD: آشکارساز MultiBox تک شات. در مجموعه مقالات چشم انداز کامپیوتر-ECCV 2016، آمستردام، هلند، ۱۱ تا ۱۴ اکتبر ۲۰۱۶؛ ص ۲۱-۳۷٫ [ Google Scholar ]
  52. گویال، ا. بوچکوفسکی، آ. دنگ، ج. کلتون، V. شبکه های غیر عمیق. arXiv ۲۰۲۱ ، arXiv:2110.07641v1. [ Google Scholar ]
  53. چن، ی. کالانتیدیس، ی. لی، جی. یان، اس. Feng, J. A2-Nets: Double Attention Networks. در مجموعه مقالات پیشرفت‌ها در سیستم‌های پردازش اطلاعات عصبی ۳۱: کنفرانس سالانه سیستم‌های پردازش اطلاعات عصبی ۲۰۱۸، NeurIPS 2018، مونترال، QC، کانادا، ۳ تا ۸ دسامبر ۲۰۱۸٫ صص ۳۵۰-۳۵۹٫ [ Google Scholar ]
  54. وانگ، کیو. وو، بی. زو، پی. لی، پی. زو، دبلیو. Hu, Q. ECA-Net: توجه کانال کارآمد برای شبکه های عصبی پیچیده عمیق. در مجموعه مقالات کنفرانس IEEE/CVF 2020 در مورد دید رایانه و تشخیص الگو (CVPR)، سیاتل، WA، ایالات متحده آمریکا، ۱۳ تا ۱۹ ژوئن ۲۰۲۰؛ صص ۱۱۵۳۱–۱۱۵۳۹٫ [ Google Scholar ]
  55. وو، اس. پارک، جی. لی، جی.-ای. Kweon، IS CBAM: ماژول توجه بلوک کانولوشن. در مجموعه مقالات چشم انداز کامپیوتر-ECCV 2018، مونیخ، آلمان، ۸ تا ۱۴ سپتامبر ۲۰۱۸؛ صص ۳-۱۹٫ [ Google Scholar ]
  56. یوان، تی. زو، ز. خو، ک. لی، سی. هو، اس. متن چینی در طبیعت. arXiv ۲۰۱۸ ، arXiv:1803.00085v1. [ Google Scholar ]
  57. تشخیص گوجه فرنگی قانونی، MO بر اساس چارچوب اصلاح شده YOLOv3. علمی Rep. ۲۰۲۱ , ۱۱ , ۱۴۴۷٫ [ Google Scholar ] [ CrossRef ]
  58. کنگ، جی. فن، H. تجزیه نما پیشرفته برای تصاویر سطح خیابان با استفاده از شبکه های عصبی کانولوشنال. IEEE Trans. Geosci. Remote Sens. ۲۰۲۱ , ۵۹ , ۱۰۵۱۹–۱۰۵۳۱٫ [ Google Scholar ] [ CrossRef ]
  59. تان، م. پانگ، آر. Le, Q. EfficientDet: مقیاس پذیر و کارآمد تشخیص شی. arXiv ۲۰۱۹ ، arXiv:1911.09070v7. [ Google Scholar ]
  60. رن، اس. او، ک. گیرشیک، آر. Sun, J. Faster R-CNN: Towards towards realtime object detection with region proposal networks. IEEE Trans. الگوی مقعدی ماخ هوشمند ۲۰۱۷ ، ۳۹ ، ۱۱۳۷-۱۱۴۹٫ [ Google Scholar ] [ CrossRef ] [ PubMed ]
  61. Ge، Z. لیو، اس. وانگ، اف. لی، ز. Sun، J. YOLOX: Exceeding YOLO Series در سال ۲۰۲۱٫ arXiv ۲۰۲۱ ، arXiv:2107.08430v2. [ Google Scholar ]
  62. بوچکوفسکی، آ. وانگ، سی. لیائو، H. YOLOv4: سرعت و دقت بهینه تشخیص اشیا. arXiv ۲۰۲۰ ، arXiv:2004.10934v1. [ Google Scholar ]
  63. لیو، ال. لیو، ز. Xiong، Y. ترکیب تشخیص شی و تقسیم بندی معنایی برای تشخیص بیلبورد غیرقانونی. مد. محاسبه کنید. ۲۰۲۱ ، ۱۲ ، ۱۲۷-۱۳۲٫ [ Google Scholar ]
  64. جوزف، آر. علی، F. YOLOv3: یک پیشرفت افزایشی. arXiv ۲۰۱۸ ، arXiv:1804.02767v1. [ Google Scholar ]
شکل ۱٫ نمودار شماتیک مشخصات بصری تابلوهای فروشگاهی.
شکل ۲٫ مروری بر چارچوب پیشنهادی.
شکل ۳٫ نمودار شماتیک ماژول اصلی در ستون فقرات YOLOv5. ( الف ) نمودار شماتیک یک ماژول Conv. ( ب ) نمودار شماتیک یک ماژول C3. ( ج ) نمودار شماتیک یک ماژول SPP. (در شکل، k نشان دهنده اندازه هسته است، همان زیر).
شکل ۴٫ نمودار شماتیک یک لایه Convolutional ( a ) و یک لایه CoordConv ( b ).
شکل ۵٫ نمودار شماتیک یک ماژول SP.
شکل ۶٫ نمودار شماتیک یک ماژول CoT.
شکل ۷٫ نمودار شماتیک ماژول PSA ( a ) و ماژول SPC ( b ).
شکل ۸٫ نمودار شماتیک ماژول گلوگاه در C3_P.
شکل ۹٫ نمودار شماتیک ماژول IFSPP.
شکل ۱۰٫ نمودار شماتیک زیر ماژول گلوگاه در ماژول C3_SC.
شکل ۱۱٫ نمودار شماتیک یک بلوک توجه.
شکل ۱۲٫ نمونه هایی که با روش های مختلف روی مجموعه داده CTW خود برچسب گذاری شده شناسایی شده اند.
شکل ۱۳٫ تأثیر ماژول‌های مختلف بر دقت به‌دست‌آمده در مجموعه داده CTW برچسب‌گذاری‌شده ( a ) و مجموعه داده Baidu خود برچسب‌گذاری‌شده ( b ) (A نشان‌دهنده روش YOLOv5_l، B نشان‌دهنده اضافه شدن لایه CoordConv، C است. نشان دهنده اضافه شدن ماژول های C3_SC و C3_P، D نشان دهنده اضافه شدن ماژول IFSPP، E نشان دهنده اضافه شدن ماژول CBAM، و F نشان دهنده روش کامل شرح داده شده در این مقاله است.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

خانهدربارهتماسارتباط با ما