شناسایی موجودیت با نام جغرافیایی با استفاده از پردازش زبان طبیعی و مدل بهبود یافته BERT


خلاصه

تشخیص نام مکان، یا چالش تشخیص نام مکان هایی که مرجع مشابهی دارند، در تعدادی از فعالیت های مرتبط با بازیابی اطلاعات جغرافیایی و علوم اطلاعات جغرافیایی دخیل است. این تحقیق بر شناخت نام های چینی از ارتباطات رسانه های اجتماعی متمرکز است. در حالی که روش‌های تشخیص موجودیت با نام گسترده اغلب برای مکان‌یابی مکان‌ها استفاده می‌شوند، دقت آن‌ها به دلیل بسیاری از ناهنجاری‌های زبانی که در پست‌های رسانه‌های اجتماعی دیده می‌شوند، مانند ساخت جملات غیررسمی، اختصارات نام، و غلط املایی، مانع می‌شود. در این مطالعه، ما یک مدل شناسایی جایگاه نام چینی را بر اساس یک شبکه عصبی ترکیبی که با این تناقضات زبانی در ذهن ایجاد شده است، توصیف می‌کنیم. روش ما تعدادی پیشرفت را به یک مدل شبکه عصبی بازگشتی دوسویه استاندارد اضافه می کند تا به تشخیص مکان در پیام های رسانه های اجتماعی کمک کند. ما نتایج یک ارزیابی گسترده از عملکرد روش‌های مختلف یادگیری ماشینی تحت نظارت را نشان می‌دهیم که مزیت طبیعی اجتناب از ویژگی‌های طراحی انسانی را دارند. مجموعه‌ای از آزمایش‌های کنترل‌شده با چهار مجموعه داده آزمایشی (یک مجموعه داده ساخته‌شده و سه مجموعه داده عمومی) عملکرد یادگیری ماشین نظارت‌شده را نشان می‌دهد که می‌تواند به نتایج خوبی در این کار دست یابد و به طور قابل‌توجهی از هفت مدل پایه بهتر عمل کند.

کلید واژه ها:

شناسایی موجودیت با نام جغرافیایی ; پیام رسانه های اجتماعی ؛ پردازش زبان طبیعی ; برت ; تشخیص نام های نامی

۱٫ معرفی

پلتفرم های رسانه های اجتماعی آنلاین، به ویژه پلتفرم های میکروبلاگ مانند Wechat و Weibo، به رویدادهای دنیای واقعی پاسخ می دهند و برای جمع آوری اطلاعات موقعیتی در زمان واقعی مفید هستند [ ۱ ، ۲ ، ۳ ، ۴ ]. مکان های جغرافیایی اغلب در این پیام ها توصیف می شوند. به عنوان مثال، Weibo به طور گسترده در واکنش و نجات در بلایا مانند زلزله، سیل، آتش سوزی و حملات تروریستی استفاده می شود. سنگ بنای کاربرد فوق الذکر ژئوپارسینگ [ ۵ ، ۶ ، ۷ ] نامیده می شود. Geoparsing یک کار دشوار پردازش زبان طبیعی (NLP) است که موارد طبیعی بیان شده را در متن آزاد به صورت مکانی (نوشته شده یا به دست آمده از طریق رونویسی خودکار) تراز می کند.۷ ، ۸ ، ۹ ]. درک تمایز بین تجزیه جغرافیایی و کدگذاری جغرافیایی مهم است. ورودی تجزیه جغرافیایی شامل هیچ اطلاعاتی در مورد مکان های مشخص شده در ورودی نیست. در ژئوکدینگ، یک نمایش متنی معتبر از مکان (آدرس) ورودی است. در نتیجه، geocoder فقط باید مختصات آدرس ارائه شده را در یک روزنامه جستجو کند. ژئوکدینگ به دلیل این واقعیت که با داده های خام زبان طبیعی سروکار دارد دشوار است. در این مقاله، ما پیشرفت اولیه را در ایجاد اولین سیستم تجزیه نام جغرافیایی برای یک زبان چینی نشان می‌دهیم. برای دستیابی به این هدف، اولین فرآیند فرعی رویکرد ما، شناسایی مکان مطالب ذکر شده است. این فرآیند فرعی در NLP شناسایی موجودیت (NER) نامیده می شود [ ۱۰, ۱۱ , ۱۲ , ۱۳ ].
نام‌های مکان تک کلمه‌ای مانند پکن، شانگهای، ژجیانگ و غیره وجود دارد. همچنین نام‌های مکان طولانی متشکل از چندین کلمه وجود دارد، مانند Ejin Jinqi Saihantaolai Sumu Township (منطقه خودمختار مغولستان داخلی). با این حال، بیشتر نام مکان ها ۱ تا ۵ کلمه طول دارند. توزیع نویسه‌های استفاده شده در نام‌های مکان چینی نیز نسبتاً پراکنده است، اما ویژگی‌های نسبتاً متمرکز نام مکان‌ها در محدوده خاصی وجود دارد. به عنوان مثال، ۳۶۸۵ کاراکتر در روزنامه چین استفاده می شود، و فراوانی خاص استفاده نسبتا پراکنده است. با این حال، برخی از این واژه‌ها و ترکیب‌های واژه‌ای آن‌ها تنها در نام‌های نامی مانند «گاچا» در مغولستان داخلی ظاهر می‌شوند، در حالی که بیشتر آن‌ها واژه‌های رایجی هستند که توانایی کلمه‌سازی قوی دارند و اغلب در کلمات غیرحجمی ظاهر می‌شوند. مانند «سوقیان» در «سو» و «کیان». بر اساس نکات فوق، نام مکان های چینی را می توان به طور تقریبی به نام های ساده و پیچیده تقسیم کرد. نام‌های ساده به آن‌هایی اطلاق می‌شود که طول‌های کوتاه (۱ تا ۵ کلمه) و نویسه‌های رایج دارند، مانند پکن، شهرداری پکن، دشت هتا، مخزن هنگیاشان و غیره. و کلماتی که دورتر هستند. بنابراین، شناسایی دقیق نام مکان های چینی از نظر فنی دشوار است و به یک جهت تحقیقاتی مهم در زمینه اطلاعات جغرافیایی تبدیل شده است. مخزن هنگیاشان و غیره نامهای پیچیده به آنهایی اطلاق می شود که درازا (بیش از پنج کلمه) یا با کاراکترها و کلمات دورتر هستند. بنابراین، شناسایی دقیق نام مکان های چینی از نظر فنی دشوار است و به یک جهت تحقیقاتی مهم در زمینه اطلاعات جغرافیایی تبدیل شده است. مخزن هنگیاشان و غیره. نامهای پیچیده به آنهایی اطلاق می شود که طولانی (بیش از پنج کلمه) یا با کاراکترها و کلماتی که دورتر هستند. بنابراین، شناسایی دقیق نام مکان های چینی از نظر فنی دشوار است و به یک جهت تحقیقاتی مهم در زمینه اطلاعات جغرافیایی تبدیل شده است.
روش‌های موجود برای تشخیص نام‌های جغرافیایی را می‌توان به سه نوع روش تقسیم کرد: روش‌های مبتنی بر قانون، روش‌های آماری و روش‌های یادگیری ماشینی [ ۱۴ ، ۱۵ ].]. روش‌های مبتنی بر قواعد به جمع‌بندی دستی واژه‌سازی‌ها و قواعد نحوی مختلف و شناسایی با روش‌های تطبیق قواعد اشاره دارد. این روش شهودی تر، آسان برای درک و گسترش است، و برای تست پیکره در مقیاس کوچک بهتر و سریعتر کار می کند. با این حال، طراحی قوانین بر دانش زبان حرفه ای و دانش دامنه متکی است، تدوین آن زمان بر است، پوشش جامع آن دشوار است و قابلیت حمل و استحکام ضعیفی دارد. رویکرد مبتنی بر آمار به دانش زبان تخصصی نیاز ندارد، قوی‌تر و انعطاف‌پذیرتر از رویکرد مبتنی بر قاعده است، و بسیار قابل حمل است، اما این سیستم به خوبی جبر زبانی را بیان نمی‌کند و به یک آموزش با حاشیه‌نویسی دستی در مقیاس بزرگ و جامع‌تر نیاز دارد. مجموعه نوشته ها. با انباشت کلان داده ها و بهبود مستمر عملکرد رایانه، روش های استخراج نام مکان مبتنی بر یادگیری عمیق به سرعت توسعه یافته اند. مدل‌های یادگیری عمیق کاربردی و قوی هستند و می‌توانند به‌طور خودکار ویژگی‌های کلیدی را یاد بگیرند و از متن استخراج کنند و به نتایج قابل‌توجهی در تشخیص نام مکان چینی دست یابند. متداول ترین مدل استفاده شده، حافظه کوتاه مدت دو جهته (LSTM) است که بر اساس تکامل شبکه های عصبی بازگشتی (RNN) است و بر کاستی های RNN در جملات وابسته طولانی غلبه می کند. LSTM دو طرفه از دو لایه پنهان LSTM با جهت مخالف برای حل بیشتر این مشکل استفاده می کند که برچسب گذاری دنباله ای فقط می تواند از اطلاعات بالا استفاده کند نه از پایین. در تحقیق فعلی در مورد تشخیص نام مکان چینی، مشکل اصلی بر شناخت نام مکان های پیچیده چینی متمرکز است. از آنجایی که طول نام مکان های پیچیده معمولا طولانی است و استفاده از کلمات و ترکیب کلمات نسبتاً کم است، مدل های فوق اغلب در تعیین مرزهای نام مکان ها مشکل دارند.
در این مقاله، ما یک مدل شبکه عصبی ترکیبی برای تشخیص نام مکان چینی بر اساس یک رمزگذار دوطرفه نمایش‌های رمزگذار دوطرفه لایت از مدل ترانسفورماتور (ALBERTs) برای استخراج کلمه بردار برای بهبود توانایی نمایش بردار متن و شناسایی موثر مکان نامنظم پیشنهاد می‌کنیم. اسامی و اختصارات نام مکان لایه شبکه عصبی دو جهته بلند و کوتاه مدت (BiLSTM) اطلاعات معنایی را در هر دو جهت در جمله جمع آوری می کند تا مرزهای موجودیت را بهتر تعیین کند. توالی توکن بهینه جهانی توسط لایه میدان تصادفی شرطی (CRF) بدست می آید.
مشارکت های اصلی این تحقیق به شرح زیر است:
(۱) TPCNER، مجموعه بزرگ خود حاشیه نویسی از حوزه های جغرافیایی با هفت دسته و ۶۴۰۶۳ نمونه برچسب، جمع آوری و ساخته شد. این مجموعه دارای مقوله‌های موجودیت بیشتر و حجم نمونه بزرگ‌تر از مجموعه‌های قبلی است. کارایی TPCNER که در این مطالعه برجسته شده است با یافته های تجربی ارزیابی در بخش ۵٫۴ بیشتر نشان داده شد .
(۲) یک مدل جدید چینی NER (CNER) برای حوزه جغرافیایی از طریق مدل پیش‌آموزشی آلبرت بهبود یافته و BiLSTM-CRF پیشنهاد شد. با یادگیری نمایش ویژگی در سطح کلمه از طریق لایه ALBERT و استخراج ویژگی های معنایی متنی متنی از طریق لایه BiLSTM، لایه CRF توالی نشانه بهینه جهانی را به دست می آورد و در نهایت عملکرد کلی مدل پیشنهادی را بهبود می بخشد.
(۳) عملکرد ALBERT-BiLSTM-CRF با استفاده از طیف وسیعی از مدل های استاندارد در TPCNER، MSRA، RenMinRiBao، و بوزون ارزیابی شد. علاوه بر این، چندین جزئیات خاص مانند اثربخشی BiLSTM و استفاده از مکانیسم CRF مورد مطالعه و بحث قرار گرفت. از طریق مقایسه‌های کامل با سایر مدل‌های پیشرفته، یافته‌های تجربی جامع بر روی مجموعه داده‌های خاص دامنه و عمومی، عملکرد مؤثر مدل پیشنهادی را تأیید کرد.
بقیه مقاله به شرح زیر سازماندهی شده است: کار فعلی در مورد شناسایی موجودیت نامگذاری شده در بخش ۲ توضیح داده شده است . پردازش ایجاد پیکره در بخش ۳ توضیح داده شده است . روش توصیه شده برای شناسایی نهادهای جغرافیایی در بخش ۴ ارائه و شرح داده شده است. بخش ۵ شامل داده ها و نتایج تجربی است. نتیجه گیری و توصیه هایی برای مطالعه بیشتر در بخش ۶ ارائه شده است.

۲٫ کارهای مرتبط

اطلاعات نام نامی حاوی اطلاعات مکان مکانی است، بنابراین تشخیص نام نامی را می توان برای کاهش بلایای اضطراری، نظارت بر افکار عمومی، برنامه ریزی شهری و سایر زمینه ها اعمال کرد [ ۱۶ ، ۱۷ ، ۱۸ ]]. به عنوان مثال، اطلاعاتی مانند نام مکان ها و بلایای طبیعی که در آنجا اتفاق می افتد را می توان از پیام های رسانه های اجتماعی منتشر شده توسط مردم، مانند توییتر استخراج کرد. پیام های رسانه های اجتماعی همچنین می توانند به نظارت و مدیریت افکار عمومی کمک کنند. مدیران می توانند رویدادهای امنیت عمومی اجتماعی را از صفحات وب و متون رسانه های اجتماعی شناسایی کنند و اطلاعات مکانی کلیدی را استخراج کنند، نظارت و هشدار اولیه حوادث امنیت عمومی اجتماعی را درک کنند و کارایی دفع زمانی امنیت اجتماعی و عمومی را بهبود بخشند. برای محافظت از حریم خصوصی عمومی، رسانه های اجتماعی به طور انتخابی مکان کاربر خاص به دست آمده در زمان واقعی را مخفی می کنند، که استخراج اطلاعات موقعیت جغرافیایی را پیچیده تر می کند. در ژوئن ۲۰۱۹، توییتر به طور رسمی ویژگی دقیق برچسب گذاری جغرافیایی را حذف کرد.۱۵ ]. ما عمدتاً اطلاعات توپونیوم متن طولانی را با جزئیات بیشتری شناسایی می کنیم تا ویژگی های آن واضح تر شود و توسعه کارهای بعدی تسهیل شود.
روش‌های تشخیص نام‌های چینی عمدتاً به سه نوع تقسیم می‌شوند، یعنی روش‌های مبتنی بر فرهنگ لغت و قانون، روش‌های یادگیری ماشینی مبتنی بر آمار و روش‌های یادگیری عمیق [ ۱۹ ، ۲۰ ، ۲۱ ]. روش مبتنی بر قانون عمدتاً تطبیق و تشخیص نام مکان را با خلاصه کردن دستی قواعد مختلف واژه‌سازی انجام می‌دهد (نقایص این روش در بخش ۱ خلاصه شده است.) که می تواند با روش های رایج یادگیری عمیق رایج ترکیب شود تا واژگان حرفه ای را تکمیل کند و استحکام مدل آموزشی را بهبود بخشد. تعداد نام‌ها با سرعتی بسیار سریع با توسعه منطقه افزایش می‌یابد و اغلب همان مکان با نام‌های متعدد نشان داده می‌شود. بنابراین، ساخت یک روزنامه قطعی نمی‌تواند محقق شود و بازشناسی خودکار نام مکان هنوز ارزش مطالعه دارد.
روش مبتنی بر آمار انعطاف‌پذیرتر از روش قاعده است، که تشخیص نام مکان را به یک مشکل حاشیه‌نویسی سریال تبدیل می‌کند، اما این روش به انتخاب قالب‌های ویژگی بستگی دارد و توانایی تعمیم ضعیفی دارد. الگوریتم های رایج یادگیری ماشین شامل مدل پنهان مارکوف (HMM)، مدل مارکوف حداکثر آنتروپی (MEMM) و مدل CRF است. در میان آنها، مدل CRF می‌تواند الگوریتم‌های انتخاب ویژگی و القای ویژگی مؤثر را برای وظایف برچسب‌گذاری توالی پیاده‌سازی کند. به این معنی که کاربران می توانند تأثیر ویژگی های تولید شده به طور خودکار بر انتزاع داده ها را ارزیابی کنند. بنابراین، ترکیب یک مدل CRF با مدل‌های پیش‌آموزشی در مقیاس بزرگ بعدی، مانند مدل BERT-CRF، می‌تواند به نتایج عالی برچسب‌گذاری توالی دست یابد، بنابراین ایده‌هایی برای تشخیص دقیق‌تر نام مکان ارائه می‌دهد.
رویکرد شناسایی نام نهاد مبتنی بر شبکه های عصبی به لطف رشد سریع یادگیری عمیق، به طور گسترده در استخراج اطلاعات متنی در بخش های متعددی استفاده می شود. متفاوت از الگوریتم های یادگیری ماشین سنتی، مدل آموزش داده شده توسط یک شبکه عصبی عمیق دارای ویژگی های ورودی و خروجی داده انتها به انتها است. این فرآیند آموزش مدل را قادر می‌سازد تا تداخل مصنوعی را برای تکمیل مستقیم وظایف خاص مطابق با ورودی داده اصلی کاهش دهد و نیازی به تنظیم دستی ویژگی‌های داده وجود ندارد [ ۲۲ ].]. RNN به ویژه در پردازش داده های توالی خوب است. شبکه‌های تکامل‌یافته LSTM، BiLSTM و واحد بازگشتی دردار دوطرفه (BiGRU) اغلب لایه CRF را برای تحقق بخشیدن به وظیفه شناسایی موجودیت نام‌گذاری شده ترکیب می‌کنند. مدل رایج‌تر BiLSTM–CRF، که مزایای BiLSTM و CRF را ترکیب می‌کند، نه تنها می‌تواند اطلاعات زمینه را برای پردازش متن طولانی حفظ کند، بلکه به لطف یک لایه CRF از اطلاعات برچسب سطح جمله نیز به طور کامل استفاده می‌کند. به طور مشابه، مدل BiGRU-CRF به طور گسترده استفاده می شود.
در سال‌های اخیر، مدل‌های پیش‌آموزشی در مقیاس بزرگ به دلیل عملکرد فوق‌العاده‌شان، به سرعت به روش ترجیحی پردازش زبان طبیعی تبدیل شده‌اند. بر این اساس، پردازش وظایف پایین دستی می تواند نتایج تشخیص مدل ترکیبی را دقیق تر کند [ ۲۳ ، ۲۴ ]. مدل‌های پیش‌آموزشی متداول شامل ترانسفورماتور پیش‌آموزشی مولد (GPT)، BERT، نمایش پیشرفته از طریق یکپارچه‌سازی دانش (ERNIE)، و غیره است .]. ما مدل BERT-wwm را به عنوان مدل پیش‌آموزشی انتخاب می‌کنیم که توسط مرکز تحقیقات محاسبات اجتماعی و بازیابی اطلاعات و تحقیقات هوش مصنوعی iFLYTEK در چین آموزش داده شده است. این یک مدل زبان پیش‌آموزشی چینی منبع باز است که از فناوری پوشش کل کلمه استفاده می‌کند، که می‌تواند وظیفه تشخیص نام مکان چینی را بهتر درک کند. بر اساس BERT-wwm، BERT-wwm-ext مجموعه داده‌های پیش‌آموزشی را گسترش می‌دهد و تعداد تکرارهای آموزشی را در طول آموزش مدل افزایش می‌دهد.
تشخیص نام نامی یکی از وظایف فرعی شناسایی موجودیت نامگذاری شده است که به وظیفه استخراج اطلاعات تعلق دارد. ما می‌خواهیم اطلاعات نام مکان را از داده‌های متن طولانی استخراج کنیم، اما مدلی که توسط مجموعه عمومی آموزش داده شده است، هنوز از دقت و ریزدانگی تشخیص نام نام‌ها بی بهره است. در پاسخ به مشکلات فوق، ما از یک پیکره چینی که فقط حاوی حاشیه نویسی نام های نامی بود استفاده کردیم و یک شبکه عصبی ترکیبی برای آموزش مدل برای به دست آوردن مدلی طراحی کردیم که در کار تشخیص نام نام های چینی بهتر عمل کند. این مدل بر اثر کلی و دانه بندی کم مدل سنتی تشخیص نهاد نامگذاری شده در تشخیص نام نامی بهبود می بخشد.

۳٫ آماده سازی مجموعه و حاشیه نویسی

برای رسیدگی به پیکره محدود چینی NER، یک پیکره جدید، TPCNER، جمع آوری و ساخته شد. مجموعه داده بر اساس مطالعات قبلی با مقوله‌های موجودیت بیشتر گسترش یافت و در نهایت شامل ۷ دسته موجودیت و ۶۴۰۶۳ نمونه مشروح شد.

۳٫۱٫ مجموعه برچسب های NER

موجودیت‌های نام‌گذاری شده در حوزه جغرافیایی، مانند سازمان‌ها، سیستم‌های آبی و شکل‌های زمین، بسیار متفاوت از موجودات در حوزه عمومی هستند. نهادهای جغرافیایی به مقدار زیادی دانش خاص دامنه نیاز دارند، بنابراین حاشیه نویسی را تا حدی دشوار می کند. در این مقاله، بر اساس تحقیقات موجود [ ۲۴ ]، دسته‌های موجودیت بیشتر به موجودیت‌های دانه‌دارتر، مانند زمین‌ها و تأسیسات مسکونی، شکل‌های زمین و سیستم‌های آب تقسیم می‌شوند. برخی از مقوله ها نیز در نظر گرفته شد، مانند حمل و نقل، خطوط لوله، مرزها، و مناطق سیاسی با مناطق دیگر. در نهایت همانطور که در جدول ۱ نشان داده شده است، هفت گروه ریزدانه پدیدار می شوند. برای تضمین یکپارچگی دسته‌های CNER، دسته «دیگران» را در این کار از پیش تعریف می‌کنیم تا برخی از موجودیت‌های مفهومی و نامطمئن را برای رشد بعدی مشخص کنیم. علاوه بر این، این مقاله منحصراً انواع موجودیت‌ها را در نظر می‌گیرد که به حوزه جغرافیایی مرتبط هستند (به عنوان مثال، نام نام و سازمان)، به جای موجودیت‌های عمومی مانند افراد (به عنوان مثال، نام شخصی). در آینده این مجموعه نیز منتشر خواهد شد. جدول ۲ ، جدول ۳ و جدول ۴ جزئیات بوزون، MSRA و RenMinRiBao را نشان می دهد.

۳٫۲٫ مجموعه مجموعه و حاشیه نویسی

در این مقاله، یک مجموعه حاشیه نویسی در مقیاس بزرگ، TPCNER، با دایره المعارف بایدو و دایره المعارف چینی جغرافیای چینی به عنوان داده های منبع (تقریباً ۲ میلیون کلمه) و با ارجاع به سیستم حاشیه نویسی موجودیت با نام جغرافیایی طراحی شده در این مقاله ایجاد شده است.
برای اطمینان از سازگاری و دقت، کار در این مقاله در دو حوزه اصلی ارائه شده است. ابتدا یک ابزار حاشیه نویسی جدید TPCNER، ChineseNERAnno، توسعه یافت ( شکل ۱ را ببینید ). روند کامل این ابزار در شکل ۱ نشان داده شده است . تکنیک پیشنهادی از واژگانی از اصطلاحات مرتبط با دامنه جغرافیایی برای حاشیه نویسی خودکار استفاده می کند که به اطمینان از سازگاری موجودیت کمک می کند. دوم، موجودیت های جدید را می توان به صورت پویا در فرهنگ لغت گسترش داد، بنابراین زمان حاشیه نویسی دستی را کاهش داد و سرعت حاشیه نویسی را افزایش داد. یک مجموعه جدید TPCNER در نهایت ساخته شد که شامل ۷ دسته، ۶۵۰۷۲۵ موجودیت و ۶۴۰۶۳ نمونه از پیش پردازش و حاشیه نویسی شده بود. این روش زیر نظر کارشناسان دامنه سه ماه طول کشید. جدول ۵نمونه های خاص TPCNER را با جزئیات بیشتر نشان می دهد. شکل ۲ داده‌های مربوط به توزیع آماری موجودیت‌های فردی را در TPCNER نشان می‌دهد، که نشان می‌دهد توزیع مجموعه آموزشی مشابه توزیع مجموعه اعتبارسنجی است. منطق و کاربرد مجموعه تعیین شده در این کار نیز در بخش ۵٫۴ بحث شده است.

۳٫۳٫ تجزیه و تحلیل ویژگی های بدنه

نام نهادهای جغرافیایی مهمترین تمایز بین موجودات جغرافیایی و در زمینه اطلاعات جغرافیایی است ( جدول ۶ را ببینید ). نام نهادها با اطلاعات مکان، عمدتاً از عناصر اطلاعات جغرافیایی پایه تشکیل شده است، با ابهام و تنوع قابل مشاهده است. در این مقاله با مطالعه استانداردهای ملی و ادبیات مربوطه، ویژگی‌های توصیفی موجودیت‌های جغرافیایی در متون را تحلیل می‌کنیم. سپس دسته‌های موجودیت با نام جغرافیایی و ویژگی‌های توصیفی را با ترکیب دستی و ترکیب داده‌ها با استانداردهای ملی به عنوان معیار ادغام می‌کنیم. توزیع برای هر دسته در TPCNER در شکل ۲ نشان داده شده است .
توصیف نام نهادهای جغرافیایی در متون چینی با ابهام، عدم قطعیت و تنوع مشخص می شود. در این مقاله به تحلیل ویژگی های توصیفی نام موجودات جغرافیایی در متون می پردازیم. پنج ویژگی اصلی توصیفی به شرح زیر خلاصه می شود:
(۱) نام نهادهای جغرافیایی متنوع است، با کلمات یا عبارات آزاد و پراکنده، اما با پوشش نسبتاً متمرکز، به عنوان مثال، نام جامعه “Daijiashanzhuang”، که در آن “Daijiashanzhuang Phase 1” و “Daijiashanzhuang Phase” وجود دارد. ۲”.
(۲) نام نهادهای جغرافیایی دارای الگوی خاصی است که اغلب با کلمات مشخصی مانند “استان، جاده، کوه” ختم می شود، به عنوان مثال، “استان هوبی” و “جاده لوما، منطقه هونگشان، استان هوبی”.
(۳) نام نهادهای جغرافیایی اغلب با کلمات مکان دنبال می شود. به عنوان مثال، “Huangshan” یک نام مکان است، و “Huangshan North” یک موجودیت نامگذاری جغرافیایی کامل است.
(۴) اسامی بسیاری از موجودات جغرافیایی به صورت اسم است، اما گاهی اوقات آنها به عنوان تعدیل کننده برای اصلاح موجودات دیگر، مانند “باگونگ کوه توفو” استفاده می شود.
(۵) اسامی واحدهای جغرافیایی با نام و بدون نام است. یعنی برخی از نهادهای جغرافیایی نام خاصی ندارند و مکان مکانی آنها باید از طریق رابطه زمینه ای مشخص شود. به عنوان مثال، «استخر» در «استخر در محدوده غرب دانشگاه» نام یک موجود جغرافیایی است، اما موقعیت مکانی آن باید با اطلاعات قبلی مشخص شود.

۴٫ مدل یادگیری عمیق ترکیبی

۴٫۱٫ چارچوب کلی و گردش کار مدل

در این مقاله، ما یک مدل شبکه عصبی ترکیبی برای تشخیص نام مکان چینی پیشنهاد می‌کنیم. ساختار کلی مدل در شکل ۳ نشان داده شده است و کل مدل به پنج قسمت تقسیم شده است: لایه ورودی، لایه ALBERT، لایه BiLSTM، لایه CRF و لایه خروجی.
ما مدل خود را از پایین به بالا ارائه می کنیم و لایه های شبکه عصبی را مشخص می کنیم. لایه ورودی حاوی کلمات جداگانه یک پیام است که به عنوان ورودی مدل استفاده می شود.
لایه بعدی با استفاده از رویکرد پیش‌آموزشی، هر کلمه را به عنوان بردار نشان می‌دهد. از جاسازی کلمات از پیش آموزش دیده برای نمایش کلمات در دنباله ورودی استفاده می کند. به طور خاص، ما از ALBERT استفاده می کنیم که معنای متفاوت یک کلمه را در زمینه های مختلف نشان می دهد. توجه داشته باشید که تعبیه‌های واژه‌ای از پیش آموزش داده شده، معنایی کلمات را بر اساس زمینه‌های استفاده معمولی آن‌ها نشان می‌دهد و بنابراین بازنمایی ایستا از کلمات را ارائه می‌دهد. در مقابل، ALBERT یک نمایش پویا برای یک کلمه با مدل سازی جمله خاصی که در آن کلمه استفاده می شود، ارائه می دهد. این لایه چهار جنبه مختلف از یک کلمه را به تصویر می‌کشد و بردارهای نمایش آن‌ها در یک بردار بزرگ به هم متصل می‌شوند تا هر کلمه ورودی را نشان دهند. سپس از این بردارها به عنوان ورودی لایه بعدی استفاده می شود که یک لایه BiLSTM متشکل از دو لایه سلول LSTM است:
لایه BiLSTM خروجی های دو لایه LSTM را ترکیب می کند و خروجی ترکیبی را به یک لایه کاملا متصل تغذیه می کند. سپس لایه بعدی یک لایه CRF است که خروجی را از لایه کاملا متصل می گیرد و برچسب گذاری ترتیبی را انجام می دهد. لایه CRF از مدل استاندارد BIEO از تحقیقات NER برای برچسب زدن هر کلمه استفاده می کند اما بر مکان ها تمرکز دارد. بنابراین، یک کلمه به صورت «B–L» (ابتدای عبارت مکان)، «I–L» (داخل عبارت مکان)، «E–L» (پایان عبارت مکان)، یا «O» حاشیه‌نویسی می‌شود. (خارج از عبارت مکان).
گردش کار مدل به شرح زیر است:
(۱) ابتدا، مجموعه داده از متن X (X ۱ , X ۲ , …, X n ) تشکیل شده است که به لایه ALBERT وارد می شود، جایی که i نشان دهنده کلمه i در متن ورودی است.
(۲) داده‌های متن ورودی در لایه ALBERT سریال‌سازی می‌شوند و مدل بردارهای ویژگی، i را بر اساس هر کلمه، i ، در متن ایجاد می‌کند تا نمایش بردار متن را افزایش دهد و i را به بردارهای کلمه E تبدیل می‌کند. = ( ۱ , ۲ , …, n ) با ویژگی های مکان بر اساس ترانسفورماتور (Trm) در لایه نمایش برداری کلمه ALBERT.
(۳) با استفاده از i به عنوان ورودی هر مرحله زمانی لایه LSTM دو طرفه و انجام محاسبه ویژگی، LSTM F = ( ۱ , ۲ , …, n ) رو به جلو و معکوس LSTM B = ( ۱ , ۲ ، …، Bn ) از لایه BiLSTM برای استخراج ویژگی های متنی و تولید ماتریس ویژگی، = ( ۱ ، ۲ ، …، n استفاده می شود.)، با اتصال موقعیت برای گرفتن اطلاعات معنایی در هر دو جهت در جمله.
(۴) ویژگی‌های انتقال بین حاشیه‌نویسی‌ها را در لایه CRF در نظر بگیرید، وابستگی‌های بین برچسب‌های مجاور را به‌دست آورید، و برچسب‌های مربوطه Y ( ۱ ، ۲ ، …، n ) را برای به دست آوردن نتایج حاشیه‌نویسی نهایی، خروجی بگیرید.

۴٫۲٫ مدل های پیش تمرینی برت و آلبرت

مدل پیش‌آموزشی پارامتر اولیه‌سازی بهتری را برای شبکه عصبی فراهم می‌کند، هم‌گرایی شبکه عصبی را تسریع می‌کند و توانایی تعمیم بهتری را در کار هدف فراهم می‌کند. توسعه مدل‌های پیش‌آموزشی به دو مرحله تقسیم می‌شود: جاسازی کلمه کم عمق و کدگذاری عمیق. مدل‌های جاسازی کلمه کم عمق عمدتاً از اطلاعات کلمه فعلی و کلمه قبلی برای آموزش استفاده می‌کنند. آنها فقط اطلاعات محلی متن را در نظر می گیرند و نمی توانند به طور موثر از اطلاعات کلی متن استفاده کنند [ ۲۲ ، ۲۷ ]. BERT از یک ساختار شبکه ترانسفورماتور دو طرفه با قابلیت معرفتی قوی‌تر برای آموزش بدنه و دستیابی به یک نمایش دو طرفه عمیق برای پیش‌آموزش استفاده می‌کند [ ۲۵ ]]. مدل BERT “مدل زبان ماسک شده” (MLM) می تواند زمینه های چپ و راست کلمه فعلی را ترکیب کند. BERT به نتایج قابل توجهی در کارهایی مانند شناسایی موجودیت نامگذاری شده [ ۲۸ ]، طبقه بندی متن، ترجمه ماشینی [ ۲۹ ] و غیره دست یافته است. بردارها
با این حال، مدل BERT شامل صدها میلیون پارامتر است و آموزش مدل به راحتی توسط حافظه سخت افزاری محدود می شود. مدل ALBERT یک مدل زبانی سبک وزن از پیش آموزش دیده است که بر اساس مدل BERT [ ۳۰ ] است. مدل BERT از یک رمزگذار ترانسفورماتور دو طرفه برای به دست آوردن نمایش ویژگی متن استفاده می کند و ساختار مدل آن در شکل ۴ نشان داده شده است . ALBERT تنها ۱۰٪ از تعداد پارامترهای مدل BERT اصلی را دارد اما دقت مدل BERT را حفظ می کند.

ساختار ترانسفورماتور مدل BERT از یک رمزگذار و رمزگشا تشکیل شده است. بخش رمزگذار عمدتاً از شش لایه یکسان تشکیل شده است و هر لایه به ترتیب از دو لایه فرعی تشکیل شده است، مکانیزم خود توجهی چند سر و شبکه تغذیه به جلو کاملاً متصل. از آنجایی که هر لایه فرعی با اتصال باقیمانده و نرمال سازی اضافه می شود، خروجی لایه فرعی را می توان به شکلی که در رابطه زیر نشان داده شده است نشان داد:

ستوب_لآyهr_oتوتیپتوتی=Lآyهrنorمتر(ایکس+(استوبLآyهr(ایکس)))

مکانیسم خودتوجهی چند سر، سه ماتریس، یعنی Q ، V ، و K را با h تبدیل خطی مختلف به نمایش می‌گذارد و در نهایت نتایج توجه متفاوت را به هم متصل می‌کند. معادله اصلی محاسبه در زیر نشان داده شده است:

آتیتیهnتیمنon_oتوتیپتوتی=آتیتیهnتیمنon(س،ک،V)
متولتیمناچهآد=سیonجآتی(ساعتهآد۱،…،ساعتهآدساعت)دبلیوO
ساعتهآدمن=آتیتیهnتیمنon(سدبلیومنس،کدبلیومنک،VدبلیومنV)
برای قسمت رمزگشا، ساختار اصلی شبیه به قسمت رمزگذار است، اما با اضافه شدن یک لایه زیرین توجه.
ALBERT از دو روش برای کاهش تعداد پارامترها استفاده می کند: (۱) پارامترسازی تعبیه شده فاکتوریل، که با تجزیه ماتریس جاسازی واژگانی عظیم به دو ماتریس کوچکتر، اندازه لایه پنهان را از اندازه ماتریس جاسازی واژگانی جدا می کند. و (ii) به اشتراک گذاری پارامتر متقابل، که به طور قابل توجهی تعداد پارامترهای مدل را با اشتراک گذاری پارامترهای لایه عصبی مدل بدون تأثیر قابل توجهی بر عملکرد آن کاهش می دهد.
در شکل، C = ( ۱ , ۲ , …, n ) نشان می دهد که هر کاراکتر در دنباله توسط یک رمزگذار ترانسفورماتور دو طرفه چند لایه (Trm) آموزش داده می شود تا در نهایت بردار ویژگی متن را بدست آورد که با E = نشان داده می شود. ( ۱ , ۲ , …, n). پس از اینکه متن ورودی ابتدا با جاسازی کلمه پردازش شد، رمزگذاری اطلاعات موقعیتی (رمزگذاری موقعیتی) هر کلمه در آن جمله اضافه می شود. این مدل ویژگی‌های متنی بیشتری را با ترکیب چندین لایه‌ی خودآگاه برای ایجاد توجه چند سر می‌آموزد. خروجی لایه مبتنی بر توجه چند سر از لایه Add&Nom عبور می کند، که در آن “Add” به معنای افزودن ورودی و خروجی لایه توجه چند سر است و “Norm” به معنای عادی سازی است. نتیجه پس از عبور از لایه Add&Nom به لایه عصبی feed-forward (Feed Forward) منتقل می شود و توسط لایه Add&Norm خروجی می شود.
ALBERT مورد استفاده در این مقاله دارای چندین ویژگی طراحی است که عملکرد آن را در تشخیص نام نامی از پیام های رسانه های اجتماعی افزایش می دهد. ابتدا، ALBERT ارائه شده ما از تعبیه‌های کلمات از پیش آموزش‌دیده استفاده می‌کند که به طور خاص از پیام‌های رسانه‌های اجتماعی مشتق شده‌اند. ما مراحل زیر را بر اساس داده‌های متنی جمع‌آوری‌شده انجام دادیم: (۱) پاکسازی داده‌ها – کدهای آشفته و جملات ناقص را حذف کردیم تا اطمینان حاصل کنیم که جملات صاف هستند. (۲) برش جملات – ما [CLS]، [SEP]، [MASK]، و غیره را به هر آیتم متن اضافه کردیم تا ۲۵٫۶ گیگابایت داده آموزشی به دست آوریم. و (۳) مجموعه آموزشی – ما به مدت ۴ روز با GPU 3090 آموزش دیدیم، با دوره تنظیم شده روی ۱۰۰۰۰۰ و نرخ یادگیری روی ۵ × ۱۰-۵ تنظیم شده است.
ما از جاسازی‌های کلمه GloVe (تعداد نشانه‌ها ۵۴۲۳۸ و حجم فرهنگ لغت ۳۹۹ کیلوبایت است) استفاده کردیم که بر روی ۲ میلیارد متن آموزش داده شد، با ۱۱ میلیارد توکن و ۱٫۸ میلیون مورد واژگان جمع‌آوری شده از دایره‌المعارف بایدو، ویبو، وی چت و غیره. این جاسازی‌های کلمه، که به‌طور خاص بر روی یک مجموعه پیام‌های رسانه‌های اجتماعی بزرگ آموزش داده شده‌اند، شامل بسیاری از کلمات بومی و کلمات ثبت نشده است که توسط افراد در پیام‌های رسانه‌های اجتماعی استفاده می‌شود. مدل‌های geoparsing و NER قبلی معمولاً از جاسازی‌های کلمه‌ای استفاده می‌کنند که بر روی متنی با قالب‌بندی مناسب، مانند مقالات خبری آموزش داده شده‌اند، و بسیاری از کلمات بومی تحت پوشش آن جاسازی‌ها نیستند. وقتی این اتفاق می‌افتد، معمولاً از جاسازی یک نشانه ناشناخته عمومی برای نشان دادن این کلمه بومی استفاده می‌شود و در نتیجه معنای واقعی کلمه از بین می‌رود. دوم، در مقایسه با مدل پایه BiLSTM–CRF،

۴٫۳٫ لایه BiLSTM

شبکه های عصبی تکراری به دلیل توانایی آنها در به خاطر سپردن اطلاعات تاریخی دنباله های متنی، برای کارهای حاشیه نویسی توالی مناسب تر هستند. یک مدل LSTM در ادبیات [ ۳۱ ، ۳۲ ، ۳۳ ، ۳۴ ] پیشنهاد شد که واحدهای حافظه طراحی شده ویژه ای را در لایه پنهان در مقایسه با RNN ها ترکیب می کند و می تواند مشکل انفجار گرادیان یا ناپدید شدن گرادیان را که RNN ها تمایل دارند به عنوان دنباله داشته باشند حل کند. طول افزایش می یابد. ساختار نورون مدل LSTM در شکل ۵ نشان داده شده است .

شبکه LSTM از سه ساختار دروازه و یک واحد حالت تشکیل شده است. این سازه‌های دروازه شامل دروازه‌های ورودی، دروازه‌های فراموشی و دروازه‌های خروجی است. گیت ورودی تعیین می کند که چه مقدار از ورودی شبکه در لحظه فعلی در حالت سلول ذخیره می شود. دروازه فراموشی به طور انتخابی اطلاعات خاصی را دور می زند. دروازه خروجی مقدار نهایی خروجی را بر اساس وضعیت سلول تعیین می کند. مشکل وابستگی طولانی مدت شبکه های عصبی مکرر را می توان با ساختار سه دروازه ای برای حفظ و به روز رسانی حالت برای عملکرد حافظه بلند مدت بهتر حل کرد. یک ساختار شبکه معمولی LSTM را می توان به طور رسمی در معادلات (۵) – (۱۰) نشان داد:

منتی=σ(دبلیومن⋅[ساعتتی-۱،ایکستی]+بمن)
fتی=σ(دبلیوf⋅[ساعتتی-۱،ایکستی]+بf)
oتی=σ(دبلیوo⋅[ساعتتی-۱،ایکستی]+بo)
سی˜تی=برنزهساعت(دبلیوج⋅[ساعتتی-۱،ایکستی]+بسی)
سیتی=fتی⊗سیتی-۱+منتی⊗سی˜تی
ساعتتی=oتی⊗تیآn ساعت(سیتی)

که در آن t نشان دهنده کلمه ورودی در لحظه t است. t نشان دهنده دروازه حافظه است. t نشان دهنده دروازه فراموشی است. t نشان دهنده گیت خروجی است. t نشان دهنده وضعیت سلول است. سی˜تینشان دهنده وضعیت سلول موقت است. t نشان دهنده خروجی حالت پنهان در هر مرحله زمانی است. t-1 نشان دهنده حالت پنهان در لحظه قبل است. t-1 نشان دهنده وضعیت سلول در لحظه قبل است. i ، f ، o و Wc نشان دهنده ماتریس وزن در وضعیت فعلی هستند. و i , f , o و C به ترتیب نشان دهنده افست وضعیت فعلی هستند.

۴٫۴٫ لایه CRF

مدل میدان تصادفی شرطی یک مدل احتمالی افتراقی است [ ۳۴]. مدل میدان تصادفی شرطی مزایای مدل HMM و حداکثر آنتروپی (MEM) را ترکیب می کند. این به شرایط فرض استقلال دقیق مدل پنهان مارکوف می پردازد، از معایب بهینه محلی و مشکل سوگیری برچسب گذاری مدل حداکثر آنتروپی جلوگیری می کند، برای برچسب گذاری داده های توالی CRF مناسب است، مشکل ترتیبی را در بین برچسب ها در نظر می گیرد، و به دست می آورد. توالی برچسب‌گذاری بهینه جهانی از طریق رابطه برچسب‌های مجاور، اضافه کردن محدودیت‌ها به برچسب‌های پیش‌بینی‌شده نهایی. به عنوان مثال، برچسبی که با “B” شروع می شود توسط یک تگ کلاس “O” دنبال نمی شود و برچسبی که با “E” شروع می شود را نمی توان به صورت متوالی با تگ “I” مرتبط کرد. با فرض اینکه ورودی مدل، x = ( ۱ , ۲ , …,n )، دارای دنباله ای از تگ ها است، y = ( ۱ , ۲ , …, n ), بردار نمره جمله را می توان با رابطه (۷) محاسبه کرد:

سجorه(ایکس،y)=∑j=1nپمن،yمن+∑j=0nآyمن،yمن+۱

که در آن i ، yi احتمال برچسب i کاراکتر، و A ماتریس احتمال انتقال است. همانطور که در رابطه (۸) نشان داده شده است، بردار امتیاز CRF با استفاده از تابع log-lilihood به عنوان تابع ضرر، نرمال و آموزش داده می شود:

ال جی(پ(y∣ایکس))=سجorه(ایکس،y)-ال جی(∑y”∈Yایکسانقضا(سجorه(ایکس،y”)))

در مرحله پیش‌بینی، مدل شبکه با استفاده از الگوریتم Viterbi برای به دست آوردن دنباله بهینه، همانطور که در رابطه (۹) نشان داده شده است، برچسب‌گذاری می‌شود:

y*=ارگ حداکثرسجorه(ایکس،y”)y”∈Yایکس

۵٫ نتایج و بحث

در چندین مجموعه داده، عملکرد مدل پیشنهادی با سایر مدل‌های یادگیری عمیق مقایسه شد. بخش‌های زیادی از داده‌های تجربی ارزیابی و مورد بحث قرار گرفت. از TensorFlow برای پیاده‌سازی مدل‌ها بر روی یک پردازنده گرافیکی NVIDIA GeForce RTX 3090 استفاده شد. با توجه به ماهیت تکرار، این نتایج ممکن است تا حدودی نسبت به نسخه های اصلی تغییر کند.

۵٫۱٫ مجموعه داده، معیارهای ارزیابی و فراپارامترها

معیارهای عملکرد : اندازه‌گیری‌های آزمایش دقت (P)، یادآوری (R) و امتیاز F1 (F1) بود. دقت، درصد نام‌های به‌درستی شناسایی‌شده (مثبت واقعی، TPs) را در بین تمام نام‌های شناخته‌شده توسط یک مدل، که شامل هر دو مثبت واقعی و مثبت کاذب (FPs) است، اندازه‌گیری می‌کند. Recall درصد نام‌هایی را که به‌درستی شناسایی شده‌اند، در میان همه نام‌هایی که به‌عنوان صدق اصلی حاشیه‌نویسی شده‌اند، اندازه‌گیری می‌کند که شامل مثبت‌های درست و منفی‌های کاذب (FNs) می‌شود. امتیاز F میانگین هارمونیک دقت و یادآوری است [ ۳۵ ]. زمانی که هم دقت و هم یادآوری نسبتاً زیاد باشد، زیاد است و اگر هر یک از این دو پایین باشد، پایین است [ ۳۶ ].
فرآیند آموزش : در این مطالعه، با استفاده از ابزار word2vec از قبل، جاسازی‌های کلمه را در پیکره ویکی‌پدیا آموزش دادیم و کلمات متوالی را برای نشان دادن یک موجودیت در زمانی که موجودیت دارای چندین کلمه بود، به هم متصل کردیم. مهمتر از آن، واژه embeddings به دست آمده توسط word2vec به عنوان نمایش اولیه کلمات استفاده شد. ما آنها را به عنوان پارامتر در نظر گرفتیم و آنها را در فرآیند آموزش اصلاح کردیم که می تواند نمایش بهتری از کلمات ارائه دهد.
روش آزمایش : ما از اعتبارسنجی متقاطع ۱۰ برابری برای آزمایش استفاده کردیم و میانگین امتیاز ۱۰ اجرا مستقل را گزارش کردیم. این منجر به مجموع ۱۰۰ تقسیم مختلف به زیر مجموعه های آموزشی/آزمایی شد.
هر کاراکتر چینی به عنوان یک نشانه در نظر گرفته شد و TPCNER با استفاده از تکنیک برچسب گذاری BIO کدگذاری شد. برای جلوگیری از برازش بیش از حد، افت تحصیلی روی ۰٫۵ تنظیم شد. با توجه به احتمال اتکای متنی بین عبارات همسایه، حداکثر طول نمونه‌ها حداکثر طول آموزش در نظر گرفته شد و ما اشاره کردیم که تقسیم نمونه‌ها ممکن است منجر به از دست دادن معنایی شود. برای کمک به همگرایی همه مدل ها، تعداد دوره ها به ۱۰۰ ثابت شد. در نسبت ۸:۲، همه مجموعه داده ها به طور تصادفی به مجموعه های آموزشی و اعتبار سنجی تقسیم شدند. جدول ۷ TPCNER را با سایر مجموعه داده ها مقایسه می کند و داده های مقایسه ای را ارائه می دهد. جدول ۸ فراپارامترهای باقی مانده را فهرست می کند.

۵٫۲٫ خطوط پایه

برای ارزیابی اثر مدل ارائه شده، روش خود (ALBERT-BiLSTM-CRF) را با شش خط پایه قوی (DBN، DM_NLP، NeuroTPR، CheseBERTTP، ChinaTR و GazPNE2) به صورت تجربی مقایسه کردیم. به منظور تضمین مقایسه نسبتاً منصفانه، برای این خطوط پایه، ما از کدهای منبع منتشر شده عمومی آنها استفاده کردیم و تنظیمات پارامتر گزارش شده در مقالات آنها را دنبال کردیم.
  • DBN یک رویکرد تشخیص نام اقتباس شده مبتنی بر شبکه باور عمیق (DBN) با بررسی دو موضوع کلیدی است: نمایش کلمه و تفسیر مدل ارائه شده توسط [ ۳۷ ].
  • DM_NLP یک مدل کلی بر اساس BiLSTM–CRF است که توسط [ ۳۸ ] پیشنهاد شده است.
  • NeuroTPR یک مدل Neuro-net ToPonym Recognition است که به طور خاص با در نظر گرفتن این بی نظمی های زبانی طراحی شده است که توسط [ ۳۹ ] پیشنهاد شده است.
  • ChineseBERTTP یک شبکه عصبی عمیق به نام BERT-BiLSTM-CRF است که یک مدل پایه شبکه عصبی بازگشتی دوطرفه (BiLSTM) را با نمایش رمزگذار دو طرفه پیش‌آموز از نمایش ترانسفورماتورها (BERT) گسترش می‌دهد تا وظیفه تشخیص نام نامی را در متن چینی انجام دهد [ ۴۰ ].
  • ChinaTR یک معماری تشخیص نام نامی چینی با نظارت ضعیف است که از ایجاد کننده مجموعه داده های آموزشی استفاده می کند که مجموعه داده های آموزشی را به طور خودکار بر اساس مجموعه های کلمات و بسامدهای کلمه مرتبط از متون مختلف و یک شناساگر پسوندی ایجاد می کند که از یک شبکه عصبی بازگشتی دو طرفه اولیه بر اساس ویژگی های خاص طراحی شده برای توپونیم استفاده می کند. به رسمیت شناختن پیشنهاد شده توسط [ ۴۱ ].
  • GazPNE2 یک رویکرد کلی برای استخراج نام مکان ها از توییت ها است که GazPNE2 نام دارد. این روزنامه جهانی (به عنوان مثال، OpenStreetMap و GeoNames)، یادگیری عمیق، و مدل های ترانسفورماتور از پیش آموزش دیده (به عنوان مثال، BERT و BERTweet)، که نیاز به داده های دستی شرح داده شده را ترکیب می کند [ ۴۲ ].

۵٫۳٫ آزمایشات روی TPCNER

در این مطالعه HMM، CRF، BiLSTM–CRF، IDCNN–CRF، IDCNN–CRF2، BiLSTM–Attention–CRF، BERT–BiLSTM–CRF، BERT–BiGRU–CRF، ALBERT–BiLSTM، ALBERT old –BiLSTM–CRF ( مدل‌های ALBERT اصلی)، و مدل‌های ALBERT ما -BiLSTM-CRF (ALBERT ارائه‌شده ما) برای آزمایش مجموعه داده TPCNER مورد استفاده قرار گرفتند و عملکرد شناسایی موجودیت نام‌گذاری شده توسط چهار شاخص ارزیابی شد: دقت، دقت، یادآوری، و امتیاز F1. نتایج تجربی در جدول ۹ نشان داده شده است. نتایج زیر قابل مشاهده است:
(۱) در مقایسه با مدل های غیر شبکه عصبی (یعنی HMM و CRF)، مدل های شبکه عصبی عملکرد را به طور قابل توجهی بهبود می بخشند، زیرا عملکرد اولی به سرعت بدتر می شود، در حالی که دومی می تواند عملکرد معقولی را حفظ کند. این به دلیل این واقعیت است که بیشتر ویژگی‌های مورد استفاده در مدل‌های غیر شبکه عصبی از ویژگی‌های طراحی‌شده توسط انسان می‌آیند، که از خطاهای انباشته‌ای رنج می‌برند که ممکن است منجر به کاهش عملکرد شود.
(۲) می بینیم که این یازده مدل عملکرد خوبی در مجموعه داده TPCNER به دست آوردند و دقت، دقت، فراخوانی و امتیازات F1 آنها اغلب از ۸۰% فراتر رفت. در میان آنها، مدل ALBERT ours –BiLSTM–CRF بهترین اثر تست را دارد و دقت، دقت، یادآوری و امتیاز F1 آن به ترتیب ۹۷٫۸٪، ۹۶٫۱٪، ۹۶٫۲٪ و ۹۶٫۱٪ است. در مقایسه با ۹ مدل دیگر، این مدل تأثیر بهتری در تشخیص نهاد نامگذاری شده بر روی مجموعه داده TPCNER دارد. به ویژه، مدل ALBERT دوباره آموزش دیده ما در مقایسه با مدل ALBERT اصلی ۷٫۸٪ بهبود یافته است.
(۳) علاوه بر این، IDCNN-CRF2 عملکرد بهتری نسبت به IDCNN-CRF به دست آورد، و IDCNN-CRF و BiLSTM-CRF تقریباً عملکرد یکسانی را به دست آوردند. هر دوی این نتایج نشان می‌دهند که IDCNN از پیچش گشاد شده برای افزایش سرعت تمرین استفاده می‌کند و ویژگی‌های توالی را برای بهبود عملکرد افزایش نمی‌دهد.
ما آزمایشات خود را با مقایسه ALBERT-BiLSTM-CRF با شش مدل مبتنی بر یادگیری عمیق ادامه دادیم. عملکرد این مدل ها بر روی مجموعه داده TPCNER در جدول ۱۰ گزارش شده است. ما مشاهدات زیر را انجام دادیم:
(۱) ALBERT-BiLSTM-CRF بالاترین دقت را با فراخوانی یکسان ارائه می دهد. علاوه بر این، ALBERT-BiLSTM-CRF نسبت به ChineseBERTTP که در حال حاضر بهترین نتایج گزارش شده در این مجموعه داده را با دقت بالاتر برای همان فراخوانی دارد، بهبود ثابت و قابل توجهی را به دست می آورد. ما بر این باوریم که ترکیبی از ویژگی‌های ALBERT که به‌ویژه طراحی شده‌اند، ویژگی‌های مهم‌تری را تشکیل می‌دهند و استخراج‌کننده را برای پیش‌بینی دقیق ترغیب می‌کنند.
(۲) در مقایسه با مدل پایه BiLSTM–CRF، ALBERT–BiLSTM–CRF در هر سه معیار بهتر عمل می‌کند، بنابراین ارزش طرح‌های بهبودیافته ما، از جمله لایه‌های ALBERT ویژه طراحی‌شده را نشان می‌دهد. در مقایسه با DM_NLP و NeuroTPR، ALBERT–BiLSTM–CRF دقت بالاتر، امتیاز F1 بالاتر و یادآوری مشابهی را نشان می‌دهد.
همانطور که از جدول ۶ و جدول ۷ انتظار می رود ، برای همه مجموعه داده ها، ALBERT متعلق به ماست–BiLSTM–CRF بهترین امتیاز F1 یعنی ۹۶٫۱% را کسب می کند. در مقایسه با دو مدل یادگیری عمیق با نظارت ضعیف (NeuroTPR و GazPNE2)، مدل ارائه‌شده ما در هر سه معیار بهتر عمل می‌کند، بنابراین ارزش طراحی بهبودیافته ما را نشان می‌دهد که حاوی یک ALBERT دقیق تنظیم شده است. دلیل این امر این است که متون چینی اغلب شامل تعداد قابل توجهی از نام‌های مکان هستند که ممکن است توسط BERT اصلی پوشش داده نشود، از جمله بسیاری از کلمات بومی (مانند “کوه‌های منگلیانگ” و “فلات”) و اختصارات (مانند “دیدا” و “CUG”) توسط افراد اعمال می شود. وقتی این اتفاق می‌افتد، معمولاً از جاسازی رمز ناشناخته عمومی برای نشان دادن کلمه بومی استفاده می‌شود و معنای واقعی کلمه از بین می‌رود.

۵٫۴٫ آزمایشات روی مجموعه داده عمومی

برای بررسی بهتر عملکرد مجموعه داده و مدل TPCNER، این مقاله همچنین از BiLSTM–CRF، IDCNN–CRF، IDCNN–CRF2، BiLSTM–Attention–CRF، BERT–BiLSTM–CRF، BERT–BiGRU–CRF، ALBERT–BiLSTM استفاده می‌کند. و مدل های ALBERT–BiLSTM–CRF برای آزمایش بر روی مجموعه داده Boson، مجموعه داده MSRA و مجموعه داده RenMinRiBao و از دقت، یادآوری و امتیازات F1 برای ارزیابی عملکرد شناسایی موجودیت نامگذاری شده استفاده می کند. نتایج تجربی در جدول ۱۱ نشان داده شده است. نتایج تجربی نشان می دهد که این هشت مدل به نتایج خوبی در این سه مجموعه داده دست می یابند. در مقایسه با هفت مدل دیگر، مدل ALBERT–BiLSTM–CRF بهترین عملکرد را دارد. دقت، فراخوانی و امتیاز F1 آن از سه مجموعه داده بالاتر از مدل های دیگر است. در مقایسه با سه مجموعه داده عمومی، اثر شناسایی موجودیت نامگذاری شده مجموعه داده TPCNER اساساً یکسان است و به بیش از ۹۵٪ می رسد. علاوه بر این، این مقاله همچنین امتیاز F1 مدل های BERT-BiLSTM-CRF، BERT-BiGRU-CRF، ALBERT-BiLSTM، و ALBERT-BiLSTM-CRF را پس از تنظیم فراپارامتر، همانطور که در شکل ۶ نشان داده شده است، شمارش و تجسم می کند . به وضوح می توان از شکل مشاهده کرد که امتیاز F1 مدل ALBERT-BiLSTM-CRF به طور قابل توجهی بالاتر از چهار مدل دیگر است.
در مجموع ۳۶ آزمایش کنترل شده برای تعیین بهترین تعداد عبارات برچسب‌گذاری شده از مجموعه داده ایجاد شده و تجزیه و تحلیل اندازه مجموعه داده برچسب‌گذاری شده انجام شد. اولین کارآزمایی از ۱۰۰۰ جمله استفاده کرد، در حالی که آزمون های باقیمانده از محدوده ۲۰۰۰ تا ۹۰۰۰ جمله (با اندازه گام ۱۰۰۰) استفاده کردند. شکل ۷ نتایج تجربی را از نظر میانگین دقت و یادآوری نشان می دهد.
همانطور که در شکل ۷ مشاهده می شود ، زمانی که از ۹۰۰۰ جمله استفاده شد، الگوریتم پیشنهادی به میانگین امتیاز F1 96.2% دست یافت. BERT-BiLSTM-CRF، BERT-BiGRU-CRF، و ALBERT-BiLSTM (پایه) فقط به ترتیب به امتیازات F1 92.1٪، ۹۴٫۴٪ و ۹۵٫۳٪ رسیدند. این نشان می دهد که الگوریتم NER پیشنهادی از خط پایه بهتر عمل می کند.

۵٫۵٫ تجزیه و تحلیل فرسایش

برای تأیید اثربخشی پیش‌آموزش روی رویکردمان، مدل‌های مختلف زیر را طراحی کرده و آزمایش‌هایی را روی مجموعه داده‌های ساخته‌شده انجام می‌دهیم ( جدول ۱۲ را ببینید ).
جدول ۹ نتایج تجربی BiLSTM-CRF را به عنوان یک روش پایه نشان می دهد. در جدول ۹ ، عملکرد BiLSTM-CRF در تمام معیارهای ارزیابی در مقایسه با سایر مدل‌ها ضعیف است. علاوه بر این، از نمره کل مدل F1 در جدول ۹ ، دریافتیم که استفاده از لایه BERT یا استفاده از لایه ALBERT بالاتر از روش پایه است. این پدیده اثربخشی ترکیب مدل پیش‌آموزشی را نشان می‌دهد.
در مقایسه با BiLSTM–CRF، مقدار F1 مدل را می‌توان با استفاده از مدل پیش‌آموزشی (BERT) در جدول ۹ بهبود بخشید . دلیل ممکن است این باشد که پیش‌آموزش، توصیف بهتر ویژگی‌های توالی متن را ممکن می‌سازد. این پدیده اثربخشی استفاده از مدل پیش‌آموزشی را نشان می‌دهد.
در مقایسه با Bi-LSTM-CRF، مدلی که از توجه فضایی استفاده می‌کند از نظر امتیاز P، R و F1 در جدول ۹ بهبود یافته است . دلیل ممکن است این باشد که مدل های از پیش آموزش دیده دامنه می توانند ویژگی های متن جغرافیایی را بهتر مشخص کنند و سپس توانایی استخراج ویژگی های رمزگذاری BiLSTM را بهبود می بخشند. این پدیده اثربخشی استفاده از مدل پیش‌آموزشی جغرافیایی را نشان می‌دهد.

۵٫۶٫ بحث

۵٫۶٫۱٫ مطالعه ابلیشن

ما بر تجزیه و تحلیل مجموعه داده های ساخته شده (TPCNER) تمرکز کردیم. ما نمونه ای از مجموعه TPCNER را بررسی کردیم تا ببینیم آیا مدل ارائه شده می تواند موارد را در حوزه جغرافیایی بهتر تشخیص دهد. در این مثال، نهاد “بیمارستان گولو دانشگاه مهندسی هاربین” تنها دو بار در مجموعه آموزشی ظاهر شد. نهاد “بیمارستان گولو دانشگاه مهندسی هاربین” توسط مدل BERT-BiLSTM-CRF به عنوان دو نهاد، “دانشگاه مهندسی هاربین” و “بیمارستان گولو”، همانطور که در جدول ۱۳ نشان داده شده است، شناخته می شود.. از آنجایی که این دو مورد در مجموعه آموزشی فراوانتر هستند، تشخیص بدون اطلاعات تقویتی فریبنده خواهد بود. به دلیل اطلاعات مرزی نادرست، مدل BERT-BiLSTM-CRF به اشتباه “بیمارستان گولو دانشگاه مهندسی هاربین” را به عنوان یک موجودیت طبقه بندی می کند. از آنجایی که اطلاعات تقویت گسترده تری در مدل پیشنهادی ما گنجانده شده است، پیش بینی های دقیقی را ارائه می دهد. علاوه بر این، اصطلاحات “دانشگاه مهندسی هاربین” و “بیمارستان گولو” در نمونه مشابه هستند، که دلالت بر رابطه تنگاتنگ‌تر بین ویژگی‌های واحد تجاری دارد.
۵٫۶٫۲٫ تجزیه و تحلیل خطا
ما جملات زیادی را از مجموعه تست انتخاب کردیم و اشتباهات نمونه آنها را برای ارزیابی خروجی واقعی مدل‌های مختلف ارزیابی کردیم. شکل ۸ نتایج تشخیص مدل های BERT-BiLSTM-CRF، BERT-BiGRU-CRF، ALBERT-BiLSTM، و ALBERT-BiLSTM-CRF را در متون نمونه نشان می دهد، که در آن کاراکترهای قرمز نشان دهنده خطا هستند.
همانطور که در شکل ۸ نشان داده شده است، مدل ما از نظر تشخیص بهتر از بقیه بود، در حالی که مدل BERT-BiLSTM-CRF نتوانست موجودیت های تودرتو را تشخیص دهد. به عنوان مثال، ALBERT–BiLSTM–CRF «Yang Xinhe» را به‌عنوان یک موجودیت در مورد ۱ شناسایی کرد، اما مدل‌های دیگر نمی‌توانند این موجودیت را تشخیص دهند، زیرا نام مکانی است که از نام یک شخص تشکیل شده است و الگوریتم‌های زیادی نام فرد را تشخیص می‌دهند. در مورد ۲، BERT–BiLSTM–CRF «Horqin» را به‌عنوان یک موجودیت شناسایی می‌کند، اما شخصیت‌های مرتبط «Right Wing Front Banner Debs Town» که در فاصله‌ای طولانی در بافت قرار داده شده‌اند، از قلم افتاده است. مدل ALBERT–BiLSTM–CRF با موفقیت موجودیت‌های تودرتوی ریزدانه «شهرک دیبز، بنر جلوی جناح راست هورکین» را در مورد ۲ شناسایی کرد.
با تجزیه و تحلیل نتایج تشخیص، دریافتیم که (۱) دلیل تأثیرگذاری بر دقت مدل این است که برخی از نام‌ها در داده‌ها حاوی کلمات توپونیمی هستند که در نتیجه یادآوری نادرست است، به عنوان مثال، «Yang Xinhe» و «Li Qingxian». ; (۲) دلیل کم یادآوری این است که برخی از نام‌های پیچیده به درستی تشخیص داده نمی‌شوند، به عنوان مثال، “Deebs Town of Horqin Front-wing Front Benner” به درستی شناسایی نشده است. به عنوان مثال، در «فاجعه باد و تگرگ باعث ریزش محصول در شهرک دبس از سمت راست بنر جلویی هورقین شد»، «بلند جلوی جناح راست شهرک دبس هورقین» به درستی شناسایی نشد. در مواجهه با باران و سیل، Qiongzhong Li و شهرستان خودمختار Miao فوراً جابجا شدند. نام «شهرستان خودمختار چیونگ ژونگ لی و میائو» به درستی در «۳۵ نفر» شناسایی نشده است. دلیلش طولانی بودن نام مکان است،
۵٫۶٫۳٫ تجزیه و تحلیل کیفیت مشروح
BiLSTM-CRF و IDCNN به عنوان اساسی‌ترین مدل‌ها در نظر گرفته می‌شوند و برای ارزیابی کیفیت مجموعه مشروح، با استفاده از اعتبارسنجی متقابل ۱۰ برابری سلسله مراتبی استفاده شدند [ ۳۶ ، ۳۷ ]. در سطح کلان، نتایج تجربی دقیق ارائه شده در جدول ۶نشان می دهد که BiLSTM-CRF و IDCNN به ترتیب به امتیازات F1 86% و ۸۷% می رسند. در سطح خرد، BiLSTM-CRF و IDCNN عملکرد عالی را برای ترافیک، سیستم‌های آب و سازمان نشان می‌دهند، بنابراین سهولت شناسایی این دسته‌ها را نشان می‌دهند. به طور خاص، برای آژانس های سازمانی، امتیاز F1 هر دو مدل به ترتیب ۹۲٫۱۶٪ و ۹۳٫۷۹٪ است. به دلیل عدم تطابق ایجاد شده به دلیل عدم وجود ویژگی های مرزی و استفاده ترکیبی از نویسه ها، اعداد و حروف، تشخیص برخی چیزها مانند نام مکان های بسیار مشخص، نام مکان های مختلط و نام مکان های ادغام شده، دشوار است. شکل ۲ نشان می دهد که چگونه کمبود داده برای برخی دسته ها بر عملکرد تأثیر می گذارد. علاوه بر این، همانطور که در شکل ۵ نشان داده شده است، چندین اشتباه پیش بینی را ذکر کردیم. به طور کلی، یافته‌های ارزیابی نشان می‌دهد که مجموعه شرح‌داده‌شده در این مطالعه قابل اعتماد است و ممکن است برای شناسایی موجودیت‌های حوزه جغرافیایی مورد استفاده قرار گیرد.
ماتریس سردرگمی در شکل ۹ و شکل ۱۰ تعداد نام‌هایی را نشان می‌دهد که با استفاده از الگوریتم پیشنهادی از مجموعه داده استخراج شده‌اند، و همچنین تعداد حاشیه‌نویسی‌های استاندارد طلایی را برای هر کلاس توپونیوم نشان می‌دهد. شکل ۱۰ نشان می دهد که الگوریتم پیشنهادی دقت نسبتاً کمتری برای کلاس های نام های TRA دارد. این را می توان به عدم تعادل داده نسبت داد. عدم تعادل در تعداد موجودیت باعث می‌شود که الگوریتم بر روی حداقل کردن خطاهای طبقه‌بندی برای موجودیت‌های دارای تعداد بیشتر تمرکز کند، در حالی که خطاها را برای موجودیت‌هایی با تعداد کمتر در نظر نمی‌گیرد.

۶٫ نتیجه گیری و کار آینده

در این مقاله، ما یک روش شبکه عصبی ترکیبی برای تشخیص نام مکان چینی پیشنهاد می‌کنیم که مشکلات فوق را با یادگیری نمایش ویژگی‌های سطح کلمه در لایه ALBERT، استخراج ویژگی‌های معنایی متنی در لایه BiLSTM، و تولید دنباله‌های برچسب بهینه در لایه حل می‌کند. لایه CRF نتایج تجربی نشان می دهد که روش تشخیص نام نامی پیشنهادی عملکرد خوبی در تمامی شاخص های ارزیابی دارد. ما ALBERT-BiLSTM-CRF را با استفاده از یک مجموعه داده مشروح شده توسط انسان و سه مجموعه داده عمومی آموزش می دهیم. ما چندین روش آموزشی را آزمایش کردیم و متوجه شدیم که ترکیبی از داده‌های حاشیه‌نویسی شده توسط انسان، بهترین نتایج را ایجاد می‌کند. آزمایش‌های ارزیابی بر اساس سه مجموعه داده آزمایشی، یعنی Boson، MSRA و RenMinRiBao، عملکرد بهبود یافته ALBERT-BiLSTM-CRF را در مقایسه با مجموعه ای از مدل های یادگیری عمیق نشان می دهد. این کار تلاش کرد تا به عنوان منبعی برای مطالعات شناسایی موجودیت نامگذاری شده در مناطق مختلف جغرافیایی باشد. ما روی اضافه کردن ویژگی های بیشتر و ایجاد تغییرات معقول تر در وزن این ویژگی ها در آینده کار خواهیم کرد.

منابع

  1. عمران، م. کاستیو، سی. دیاز، اف. Vieweg، S. پردازش پیام های رسانه های اجتماعی در شرایط اضطراری جمعی: یک نظرسنجی. کامپیوتر ACM. Surv. ۲۰۱۵ ، ۴۷ ، ۶۷٫ [ Google Scholar ] [ CrossRef ]
  2. Silverman, L. Facebook, Twitter جایگزین ۹۱۱ Calls for Stranded in Houston. ۲۰۱۷٫ در دسترس آنلاین: https://www.npr.org/sections/alltechconsidered/2017/08/28/546831780/texas-police-and-residents-turn-to-social-media-to-communicateamid-harvey (دسترسی در ۱۲ سپتامبر ۲۰۱۷).
  3. یو، م. هوانگ، Q. کین، اچ. شیل، سی. یانگ، سی. یادگیری عمیق برای طبقه‌بندی متن رسانه‌های اجتماعی در زمان واقعی برای آگاهی از موقعیت – استفاده از طوفان‌های سندی، هاروی و ایرما به عنوان مطالعات موردی. بین المللی جی دیجیت. زمین ۲۰۱۹ ، ۱۲ ، ۱۲۳۰-۱۲۴۷٫ [ Google Scholar ] [ CrossRef ]
  4. هو، ی. مائو، اچ. مک‌کنزی، جی. یک چارچوب پردازش زبان طبیعی و خوشه‌بندی جغرافیایی برای برداشت نام مکان‌های محلی از آگهی‌های مسکن دارای برچسب جغرافیایی. بین المللی جی. جئوگر. Inf. علمی ۲۰۱۸ ، ۳۳ ، ۷۱۴-۷۳۸٫ [ Google Scholar ] [ CrossRef ]
  5. فریره، ن. بوربینها، جی. کالادو، پی. مارتینز، بی. یک سیستم تجزیه و تحلیل جغرافیایی فراداده برای تشخیص و تفکیک نام مکان در سوابق فراداده. در مجموعه مقالات یازدهمین کنفرانس مشترک بین المللی ACM/IEEE در کتابخانه های دیجیتال، اتاوا، ON، کانادا، ۱۳ تا ۱۷ ژوئن ۲۰۱۱٫ صص ۳۳۹-۳۴۸٫ [ Google Scholar ]
  6. گلرنتر، جی. بالاجی، س. الگوریتمی برای تجزیه جغرافیایی محلی ریزمتن. Geoinformatica ۲۰۱۳ ، ۱۷ ، ۶۳۵-۶۶۷٫ [ Google Scholar ] [ CrossRef ]
  7. گریتا، م. پیله ور، MT; لیمسوپاتام، ن. Collier, N. چه چیزی در تجزیه جغرافیایی گم شده است؟ لنگ منبع. ارزشیابی ۲۰۱۸ ، ۵۲ ، ۶۰۳-۶۲۳٫ [ Google Scholar ] [ CrossRef ]
  8. جونز، CB; Purves، RS بازیابی اطلاعات جغرافیایی. بین المللی جی. جئوگر. Inf. علمی ۲۰۰۸ ، ۲۲ ، ۲۱۹-۲۲۸٫ [ Google Scholar ] [ CrossRef ]
  9. Purves، RS; کلاف، پی. جونز، CB; هال، MH; مرداک، وی. بازیابی اطلاعات جغرافیایی: پیشرفت و چالش در جستجوی فضایی متن. پیدا شد. Trends® Inf. Retr. ۲۰۱۸ ، ۱۲ ، ۱۶۴-۳۱۸٫ [ Google Scholar ] [ CrossRef ]
  10. درچینسکی، ال. نیکولز، ای. ون ارپ، ام. Limsopatham، N. نتایج کار مشترک WNUT2017 در مورد شناسایی موجودیت جدید و نوظهور. در مجموعه مقالات سومین کارگاه در مورد متن نویز تولید شده توسط کاربر، کپنهاگ، دانمارک، ۷ سپتامبر ۲۰۱۷؛ صص ۱۴۰-۱۴۷٫ [ Google Scholar ]
  11. لی، اچ. وانگ، ام. بالدوین، تی. تومکو، م. Vasardani، M. UniMelb در SemEval-2019 Task 12: ترکیب چند مدل برای تفکیک نام نامی. در مجموعه مقالات سیزدهمین کارگاه بین المللی ارزیابی معنایی، مینیاپولیس، MN، ایالات متحده، ۶-۷ ژوئن ۲۰۱۹؛ ACL: استرودزبورگ، PA، ایالات متحده آمریکا؛ ص ۱۳۱۳–۱۳۱۸٫ [ Google Scholar ]
  12. کیو، کیو. زی، ز. وو، ال. تائو، ال. Li، W. BiLSTM-CRF برای شناسایی موجودیت با نام زمین شناسی از ادبیات علم زمین. علوم زمین آگاه کردن. ۲۰۱۹ ، ۱۲ ، ۵۶۵-۵۷۹٫ [ Google Scholar ] [ CrossRef ]
  13. کیو، کیو. زی، ز. وو، ال. Tao, L. GNER: یک مدل مولد برای شناسایی موجودیت با نام زمین‌شناسی بدون داده‌های برچسب‌گذاری شده با استفاده از یادگیری عمیق. علوم فضایی زمین ۲۰۱۹ ، ۶ ، ۹۳۱–۹۴۶٫ [ Google Scholar ] [ CrossRef ]
  14. سانتوس، آر. موریتا-فلورس، پی. کالادو، پی. مارتینز، بی. تطبیق نام از طریق شبکه های عصبی عمیق. بین المللی جی. جئوگر. Inf. علمی ۲۰۱۸ ، ۳۲ ، ۳۲۴-۳۴۸٫ [ Google Scholar ] [ CrossRef ]
  15. وانگ، جی. Hu, Y. تقویت تحلیل فضایی و متنی با EUPEG: یک پلت فرم توسعه یافته و یکپارچه برای ارزیابی geoparers. ترانس. GIS ۲۰۱۹ , ۲۳ , ۱۳۹۳–۱۴۱۹٫ [ Google Scholar ] [ CrossRef ]
  16. هرسکویتز، الف. زبان و شناخت فضایی: مطالعه میان رشته ای حروف اضافه در زبان انگلیسی . انتشارات دانشگاه کمبریج: کمبریج، بریتانیا، ۱۹۸۶٫ [ Google Scholar ]
  17. Talmy, L. Toward a Cognitive Semantics: Concept Structuring Systems ; انتشارات MIT: کمبریج، MA، ایالات متحده آمریکا، ۲۰۰۰٫ [ Google Scholar ]
  18. سهام، K. Yousaf, J. تفسیر خودکار متن آگاه از توصیفات مفصل زبان طبیعی مکان از طریق یادگیری از داده های تجربی. بین المللی جی. جئوگر. Inf. علمی ۲۰۱۸ ، ۳۲ ، ۱۰۸۷-۱۱۱۶٫ [ Google Scholar ] [ CrossRef ]
  19. کوهن، دبلیو. راویکومار، پی. Fienberg، S. مقایسه معیارهای فاصله رشته برای وظایف تطبیق نام. در مجموعه مقالات کارگاه آموزشی KDD در مورد پاکسازی داده ها و تلفیق اشیاء، واشنگتن، دی سی، ایالات متحده آمریکا، ۲۴ تا ۲۷ اوت ۲۰۰۳٫ [ Google Scholar ]
  20. مورو، ای. ایوان، اف. Capp، EO معیارهای تشابه قوی برای تطبیق موجودیت های نامگذاری شده. در مجموعه مقالات کنفرانس بین المللی زبان شناسی محاسباتی، منچستر، انگلستان، ۱۸ تا ۲۲ اوت ۲۰۰۸٫ [ Google Scholar ]
  21. سانتوس، آر. موریتا-فلورس، پی. مارتینز، بی. آموزش ترکیب معیارهای تشابه رشته‌ای چندگانه برای تطبیق مؤثر نام‌های نام. بین المللی جی دیجیت. زمین ۲۰۱۸ ، ۱۱ ، ۹۱۳-۹۳۸٫ [ Google Scholar ] [ CrossRef ]
  22. ما، ک. تان، ی. تیان، م. Xie، X. کیو، کیو. لی، اس. وانگ، ایکس. استخراج اطلاعات زمانی از پیام های رسانه های اجتماعی با استفاده از مدل BERT. علوم زمین آگاه کردن. ۲۰۲۲ ، ۱۵ ، ۵۷۳-۵۸۴٫ [ Google Scholar ] [ CrossRef ]
  23. کیو، کیو. زی، ز. ما، ک. چن، ز. تائو، ال. شبکه عصبی کانولوشنال فضایی برای استخراج رابطه فضایی از متون زبان طبیعی. ترانس. GIS ۲۰۲۱ ، ۲۶ ، ۸۳۹-۸۶۶٫ [ Google Scholar ] [ CrossRef ]
  24. کیو، کیو. زی، ز. ما، ک. چن، ز. تائو، ال. شبکه عصبی کانولوشنال فضایی برای استخراج رابطه فضایی از متون زبان طبیعی. ترانس. GIS ۲۰۲۲ ، ۲۶ ، ۸۳۹-۸۶۶٫ [ Google Scholar ] [ CrossRef ]
  25. دولین، جی. چانگ، مگاوات؛ تره فرنگی.؛ Toutanova، K. Bert: پیش آموزش ترانسفورماتورهای عمیق دو جهته برای درک زبان. arXiv ۲۰۱۸ , arXiv:1810.04805. [ Google Scholar ]
  26. رادفورد، ای. وو، جی. کودک، ر. لوان، دی. عمودی، د. Sutskever، I. مدل‌های زبان، یادگیرندگان چندوظیفه‌ای بدون نظارت هستند. وبلاگ OpenAI ۲۰۱۹ ، ۱ ، ۹٫ [ Google Scholar ]
  27. لینگ، دبلیو. دایر، سی. مشکی، AW؛ Trancoso، I. سازگاری دو/خیلی ساده از word2vec برای مشکلات نحوی. در مجموعه مقالات کنفرانس ۲۰۱۵ بخش آمریکای شمالی انجمن زبان‌شناسی محاسباتی: فناوری‌های زبان انسانی، دنور، CO، ایالات متحده آمریکا، می تا ژوئن ۲۰۱۵٫ ص ۱۲۹۹–۱۳۰۴٫ [ Google Scholar ]
  28. Lv، X.; زی، ز. خو، دی. جین، ایکس. ما، ک. تائو، ال. کیو، کیو. Pan, Y. چینی به رسمیت شناختن موجودیت در حوزه علوم زمین بر اساس BERT. علوم فضایی زمین ۲۰۲۲ ، ۹ ، e2021EA002166. [ Google Scholar ] [ CrossRef ]
  29. ما، ک. تیان، م. تان، ی. Xie، X. کیو، س. این مقاله در مورد چیست؟ خلاصه سازی تولیدی با مدل BERT در حوزه علوم زمین. علوم زمین آگاه کردن. ۲۰۲۱ ، ۱۵ ، ۲۱-۳۶٫ [ Google Scholar ] [ CrossRef ]
  30. لان، ز. چن، ام. گودمن، اس. گیمپل، ک. شارما، پ. سوریکات، آر آلبرت: یک برت ساده برای یادگیری خود نظارتی بازنمودهای زبان. arXiv ۲۰۱۹ ، arXiv:1909.11942. [ Google Scholar ]
  31. هوکرایتر، اس. Schmidhuber, J. حافظه کوتاه مدت طولانی. محاسبات عصبی ۱۹۹۷ ، ۹ ، ۱۷۳۵-۱۷۸۰٫ [ Google Scholar ] [ CrossRef ]
  32. گریوز، الف. حافظه کوتاه مدت. در برچسب زدن توالی نظارت شده با شبکه های عصبی مکرر . Springer: برلین/هایدلبرگ، آلمان، ۲۰۱۲; صص ۳۷-۴۵٫ [ Google Scholar ]
  33. کیو، کیو. زی، ز. وو، ال. Li, W. DGeoSegmenter: قطعه‌ساز واژه چینی مبتنی بر فرهنگ لغت برای حوزه علم زمین. محاسبه کنید. Geosci. ۲۰۱۸ ، ۱۲۱ ، ۱-۱۱٫ [ Google Scholar ] [ CrossRef ]
  34. آهنگ ها.؛ ژانگ، ن. Huang, H. شناسایی موجودیت نامگذاری شده بر اساس فیلدهای تصادفی شرطی. خوشه. محاسبه کنید. ۲۰۱۷ ، ۲۲ ، ۵۱۹۵–۵۲۰۶٫ [ Google Scholar ] [ CrossRef ]
  35. گوا، ایکس. ژو، اچ. سو، جی. هائو، ایکس. تانگ، ز. دیائو، ال. Li، L. بیماری‌ها و آفات کشاورزی چینی به نام شناسایی موجودیت با ویژگی‌های بافت محلی چند مقیاسی و مکانیسم توجه به خود. محاسبه کنید. الکترون. کشاورزی ۲۰۲۰ , ۱۷۹ , ۱۰۵۸۳۰٫ [ Google Scholar ] [ CrossRef ]
  36. لایتنر، ای. رهم، جی. Moreno-Schneider, J. مجموعه داده ای از اسناد حقوقی آلمانی برای شناسایی نهاد نامگذاری شده. arXiv ۲۰۲۰ ، arXiv:2003.13016. [ Google Scholar ]
  37. وانگ، اس. ژانگ، ایکس. بله، پی. Du، M. شبکه های اعتقاد عمیق بر اساس تشخیص نام نامی برای متن چینی. ISPRS Int. J. Geo-Inf. ۲۰۱۸ ، ۷ ، ۲۱۷٫ [ Google Scholar ] [ CrossRef ]
  38. وانگ، ایکس. مک.؛ ژنگ، اچ. لیو، سی. زی، پی. لی، ال. Si، L. DM NLP در SemEval 2018 Task 12: یک سیستم خط لوله برای تفکیک نام های نامی. در مجموعه مقالات سیزدهمین کارگاه بین المللی ارزیابی معنایی، مینیاپولیس، MN، ایالات متحده، ۶-۷ ژوئن ۲۰۱۹؛ ص ۹۱۷-۹۲۳٫ [ Google Scholar ]
  39. وانگ، جی. هو، ی. جوزف، K. NeuroTPR: یک مدل تشخیص توپونیم شبکه عصبی برای استخراج مکان ها از پیام های رسانه های اجتماعی. ترانس. GIS ۲۰۲۰ ، ۲۴ ، ۷۱۹-۷۳۵٫ [ Google Scholar ] [ CrossRef ]
  40. ما، ک. تان، ی. زی، ز. کیو، کیو. چن، اس. تشخیص جایگاه نام چینی با ساختارهای عصبی متفاوت از پیام‌های رسانه‌های اجتماعی بر اساس روش‌های BERT. جی. جئوگر. سیستم ۲۰۲۲ ، ۲۴ ، ۱۴۳-۱۶۹٫ [ Google Scholar ] [ CrossRef ]
  41. کیو، کیو. زی، ز. وانگ، اس. زو، ی. Lv، H.; Sun، K. ChinaTR: معماری تشخیص نام نامی با نظارت ضعیف بر اساس تولید کننده داده های آموزشی خودکار و شبکه عصبی عمیق. ترانس. GIS ۲۰۲۲ ، ۲۶ ، ۱۲۵۶-۱۲۷۹٫ [ Google Scholar ] [ CrossRef ]
  42. هو، ایکس. ژو، ز. سان، ی. کرستن، جی. کلان، اف. فن، اچ. Wiegmann, M. GazPNE2: یک استخراج کننده نام مکان عمومی برای میکروبلاگ ها در همجوشی گازترها و مدل های ترانسفورماتور از پیش آموزش دیده. IEEE Internet Things J. ۲۰۲۲ , ۹ , ۱۶۲۵۹–۱۶۲۷۱٫ [ Google Scholar ] [ CrossRef ]
شکل ۱٫ گردش کار کلی ChineseNERAnno.
شکل ۲٫ توزیع برای هر دسته در TPCNER.
شکل ۳٫ معماری کلی مدل پیشنهادی.
شکل ۴٫ ساختار اصلی مدل ALBERT.
شکل ۵٫ ساختار نورونی LSTM.
شکل ۶٫ امتیازات F1 هر مدل پس از تنظیم فراپارامتر.
شکل ۷٫ میانگین امتیاز F1 الگوریتم های NER ارائه شده و پایه با اندازه های مختلف داده های برچسب دار.
شکل ۸٫ تجزیه و تحلیل خطا برخی از موارد معمولی. آبی نشان دهنده برچسب گذاری نام مکان استاندارد و قرمز نشان دهنده نام مکان های شناسایی مدل است. ترجمه جمله “杨信河以北的李庆县发生了特大暴雨” است “باران بسیار شدیدی در شهرستان لیکینگ در شمال رودخانه یانگ شین رخ داده است”. ترجمه جمله “风雹灾害致科尔沁右翼前旗德伯斯镇作物倒伏” این است که “فاجعه باد و تگرگ باعث کشتار شهر بنر دبس جلوی جناح راست خورقین شد”.
شکل ۹٫ ماتریس سردرگمی برای همه نام های استخراج شده و استاندارد طلایی از مجموعه داده های ساخته شده بر اساس ALBERT–BiLSTM–CRF. WAT = سیستم آب؛ RLF = زمین و تاسیسات مسکونی. TRA = حمل و نقل. PIP = خطوط لوله; BRO = مرزها، مناطق، و مناطق دیگر. LAN = شکل زمین؛ ORG = سازمان.
شکل ۱۰٫ ماتریس سردرگمی برای همه نام های استخراج شده و استاندارد طلایی از مجموعه داده های ساخته شده بر اساس ALBERT–BiLSTM–CRF. WAT = سیستم آب؛ RLF = زمین و تاسیسات مسکونی. TRA = حمل و نقل. PIP = خطوط لوله; BRO = مرزها، مناطق، و مناطق دیگر. LAN = شکل زمین؛ ORG = سازمان.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

خانهدربارهتماسارتباط با ما