مقاله سیستم خبره ISI همراه با ترجمه و دیتاست درست نویسی فارسی

مقاله سیستم خبره ISI همراه با ترجمه و دیتاست درست نویسی فارسی، یکی از مقالات برتر در حوزه سیستم خبره محسوب می‌شود. فایل اصلی مقاله ۲۸ صفحه و فایل ترجمهٔ فارسی آن ۳۲ صفحه است. یکی از مزایای این مقاله، داشتن دیتاست برای دانشجویانی است که قصد پیاده‌سازی آن را دارند. با مقاله سیستم خبره ISI همراه با ترجمه و دیتاست درست نویسی فارسی همراه ما باشید.

عنوان مقاله به فارسی : یک معیار جدید اندازه‌گیری فاصله رشته‌ای در رتبه‌بندی پیشنهادات هجی‌کردن (درست‌نویسی) مجدد فارسی | عنوان مقاله به انگلیسی : A novel string distance metric for ranking Persian respelling suggestions | تعداد صفحات مقاله اصلی : ۲۸ | تعداد صفحات مقاله ترجمه : ۳۲ | فرمت : Word, PDF, Doc | قابلیت ویرایش : دارد

توجه : این مقاله در سال ۲۰۱۳ در ISI منتشر شده است و دارای فایل ترجمه با فرمت ورد می‌باشد.

چکیده

خطاهای هجی‌کردن در اسناد دیجیتال، اغلب از اشتباهات عملیاتی و شناختی ناشی می‌شوند. همچنین ممکن است فقدان دانش کامل دربارهٔ زبان اسناد مکتوب، عامل این خطاها باشد. راه‌حل‌های مبتنی بر کامپیوتر، می‌توانند این خطاها را کشف کرده و جایگزین‌هایی برای آنها پیشنهاد دهند.

معیار جدید اندازه‌گیری فاصله رشته‌ای

در این مقاله، معیاری برای اندازه‌گیری فاصله رشته‌ای در زبان فارسی ارائه می‌دهیم. هدف این معیار، رتبه‌بندی پیشنهادات هجی‌کردن مجدد واژگان فارسی است. این واژگان به اشتباه هجی شده‌اند. ما تأثیرات طرح‌بندی صفحه کلید روی خطاهای چاپی را در نظر گرفته‌ایم. همچنین ویژگی‌های هم‌آوایی و تشابه خطاهای املایی را نیز مدنظر قرار داده‌ایم. خطاهای ناشی از تفکیک نادیده‌گرفته‌شده را نیز در محاسبات خود لحاظ کرده‌ایم.

از آنجایی که این معیار را مخصوص زبان فارسی طراحی کرده‌ایم، ویژگی‌های این زبان را نشان می‌دهیم. برای مثال، واژگان متشابه، هم‌آواها و تفکیک‌کننده‌ها را معرفی می‌کنیم. سپس تحلیل آماری از مجموعه‌ای بزرگ از ساختار فارسی ارائه می‌دهیم. هدف از این تحلیل، شناسایی دلایل و انواع خطاهای هجی‌کردن در زبان فارسی است.

نتایج نشان می‌دهند که معیار پیشنهادی ما، میانگین دقت و رتبهٔ میانگین معکوس بالاتری دارد. این برتری را در مقایسه با معیارهای هامینگ، لونشتاین، دامرو–لونشتاین، واگنر–فیشر و جارو–وینکلر مشاهده کرده‌ایم. حروف متشابه، حروفی هستند که تلفظ یکسانی دارند. حروف هم‌آوا نیز حروفی هستند که کاملاً یکسان نیستند، اما به قدری شبیه‌اند که ممکن است اشتباه گرفته شوند. ما برتری سیستم خود را در غلط‌های املایی فارسی نشان داده‌ایم.

توجه : این مقاله دارای فایل دیتاست آماده جهت پیاده‌سازی مقاله می‌باشد.

مقدمه

خطا در هجی کلمات، غیرقابل اجتناب است. به همین دلیل، محققان روی غلط‌های املایی در زمینه‌های مختلف مطالعه می‌کنند. غلط‌های املایی را می‌توان به دو دسته تقسیم کرد: غلط‌های چاپی و غلط‌های املایی. همچنین می‌توان آنها را به غلط‌های مرسوم و پایدار تقسیم نمود.

غلط املایی پایدار زمانی رخ می‌دهد که نویسنده هجای صحیح را نمی‌داند. یا دربارهٔ جایگزین‌های محتمل واژه اطمینان ندارد. ممکن است نویسنده قانع شده باشد که املای صحیح واژه، یک غلط املایی است. در مقابل، غلط‌های املایی مرسوم زمانی رخ می‌دهند که نویسنده املای صحیح را می‌داند. اما از روی عجله یا بی‌توجهی، آنها را غلط می‌نویسد.

از سوی دیگر، خطاهای املایی، محصول خطاهای فرایند شناختی هستند. این خطاها زمانی رخ می‌دهند که نویسنده املای صحیح کلمات را نمی‌داند. غلط‌های املایی ممکن است بخشی باشند. برای مثال، حروفی که از لحاظ صوت‌شناسی برابر یا بسیار مشابه با هجای صحیح هستند. مانند استفاده از «مخصوص» به جای «به‌خصوص». یا غیربخشی باشند، مانند «تناوب» به جای «متناوب». برخلاف خطاهای املایی، خطاهای چاپی، خطاهای حرکتی هستند که در حین تایپ رخ می‌دهند. برای مثال، ممکن است یک حرف اشتباهاً از کلمه‌ای حذف یا به کلمه‌ای اضافه شود.

توجه : این مقاله با فرمت Word و PDF می‌باشد و قابلیت ویرایش دارد.

فاصله لونشتاین Levenshtein

فاصله لونشتاین بین دو رشته، حداقل تعداد عملیات‌های مورد نیاز برای تبدیل یک رشته به رشتهٔ دیگر است. عملیات‌ها شامل الحاق، حذف یا جانشینی یک حرف واحد می‌شوند. می‌توانیم از فاصله لونشتاین برای واژگانی با طول‌های مختلف استفاده کنیم. این واژگان از طریق الحاق یا حذف یک یا چند حرف ایجاد می‌شوند. برای مثال، فاصله لونشتاین بین «زبان» و «زیان» برابر ۲ است (۱ حذف برای حرف «ب» و ۱ الحاق برای حرف «ی»).

همانطور که در الگوریتم ۱ می‌بینیم، تابع fl(i, j) را ابتدا برای تمامی iها و jها صفر تنظیم می‌کنیم. سپس fl(i, j) را برای تمامی حروف مورد بررسی محاسبه می‌کنیم. واژهٔ مورد بررسی را با q و حروف آن را با qi نشان می‌دهیم. کل حروف واژهٔ لکسیکون را با l و حروف آن را با lj نشان می‌دهیم. فاصله لونشتاین بین q و l را به صورت تکراری محاسبه می‌کنیم. هر الحاق، حذف یا جانشینی، نمرهٔ ۱ دریافت می‌کند. در نهایت، به fl(|q|, |l|) می‌رسیم که همان فاصله لونشتاین بین q و l است.

تصاویر مقاله سیستم خبره ISI همراه با ترجمه و دیتاست درست نویسی فارسی

مقاله سیستم خبره درست نویسی فارسی

خرید از تهران آی تی به صورت آنلاین میباشد و لینک دانلود به صورت خودکار برای شما ایمیل میشود. همه گزینه‌ها همان فایل کامل را به شما می‌دهند. تفاوت فقط در نحوه جبران هزینه است؛ انتخاب با وجدان شماست. چنانچه نیاز به هرگونه سوال و یا کمک در خرید آنلاین داشتید با شماره 09121486770 تماس بگیرید. شماره کارت ما 6362141104352035 به نام محمدرضا احدیان میباشد.

مقاله سیستم خبره درست نویسی فارسی

کلمات کلیدی - تگ‌ها

از کلمات کلیدی و تگ‌های مربوط به مقاله سیستم خبره ISI همراه با ترجمه و دیتاست درست نویسی فارسی دیدن فرمایید.

تصویر کلمات کلیدی مرتبط با مقاله سیستم خبره ISI همراه با ترجمه و دیتاست درست نویسی فارسی

اشتراک‌گذاری با یک کلیک

با یک کلیک، محتوای این صفحه را در شبکه‌های اجتماعی، ایمیل یا پیام‌رسان‌های مورد علاقه‌تان به‌سرعت به اشتراک بگذارید.

اشتراک‌گذاری صفحه مقاله سیستم خبره ISI همراه با ترجمه و دیتاست درست نویسی فارسی در شبکه‌های اجتماعی

نظرات شما برای ما ارزشمند است

متاسفانه تاکنون پیامی برای این مطلب ثبت نشده است. شما اولین شخصی باشید که پیام می‌گذارد.

نظرات کاربران

فرم افزودن دیدگاه

با ارسال نظرات خود ما را در ایجاد محتوای بهتر کمک کنید.

با خدمات تهران آی تی آشنا شوید

تهران آی تی با افتخار خدمات زیر را ارائه می‌دهد.