الموجز
تُعد الترجمة الآلية (Machine Translation) أحد أهم مجالات
الذكاء الاصطناعي واللسانيات الحاسوبية ومعالجة اللغة الطبيعية (Natural Language Processing)، وهي عملية تحويل النصوص من لغة إلى أخرى باستخدام الحاسوب بلا تدخل بشري مباشر. شهد هذا المجال تطورًا كبيرًا منذ منتصف القرن العشرين، إذ انتقل من
النماذج القائمة على القواعد والمعجمات إلى الأنظمة الحديثة المعتمدة على
الشبكات العصبية (Neural Networks) والنماذج اللغوية الكبيرة (Large Language Models). ومع توسع استخدام الإنترنت وزيادة الحاجة إلى المحتوى متعدد اللغات والتخصصات، أصبحت الترجمة الآلية أداة أساسية في مجالات عديدة، مثل: الإعلام، والتعليم، والقانون. وتقوم الترجمة الآلية على نماذج وتقنيات متعددة، مع استمرار التحديات المرتبطة بدقة المعنى، وفهم السياق، والدلالة والثقافة.
نشأتها وتطورها
ترتبط الترجمة الآلية ارتباطًا وثيقًا بظهور الحواسيب، وهو ما أتاح للباحثين تخيل عملية ترجمة آلية كاملة، قبل أن تصبح في العقود الأخيرة من أبرز تطبيقات الذكاء الاصطناعي ومعالجة اللغات الطبيعية، نظرًا إلى دورها المتنامي في كسر حواجز اللغة وتسهيل التواصل بين الأفراد والمؤسسات.
تعود بدايات الترجمة الآلية إلى عام 1949 حين اقترح
وارن ويفر{{وارن ويفر (Warren Weaver، 1894–1978): عالم رياضيات أميركي، يُعدّ من رواد الترجمة الآلية. طرح في مذكرته "الترجمة" عام 1949 إمكان الإفادة من الحاسوب، ونظرية المعلومات، وأساليب التشفير في ترجمة اللغات الطبيعية.}} إمكانية استخدام الأساليب الحاسوبية (Computational Techniques) في الترجمة من خلال تحويل النصوص إلى رموز قابلة للمعالجة. وفي عام 1954، أُجريت أول تجربة بارزة في هذا المجال بالتعاون بين جامعة
جورجتاون وشركة
آي بي إم (IBM)؛ حيث تمكن النظام من ترجمة أكثر من ستين جملة من الروسية إلى الإنكليزية باستخدام قاعدة بيانات صغيرة تحتوي على 250 كلمة فقط وست قواعد لغوية يسيرة. ورغم سهولة النتائج، فإن هذه التجربة شكلت نقطة انطلاق أساسية عززت ثقة الباحثين في إمكانية تحقيق ترجمة آلية دقيقة في المستقبل[1].
ومع مرور الوقت، تطورت تقنيات الترجمة الآلية بشكل ملحوظ بفضل التقدم في قدرات الحوسبة وتوافر كميات ضخمة من البيانات النصية، وهو ما سمح بإنشاء أنظمة أكثر دقة وقدرة على التعامل مع نصوص أكثر تعقيدًا[2]. ولاحقًا، أحدث
التعلم العميق (Deep Learning) والنماذج اللغوية الكبيرة نقلة نوعية غير مسبوقة، جعلت الترجمة الآلية أكثر سلاسة وقربًا من الترجمة البشرية وتوليد النصوص طبيعيًا[3] .ورغم هذا التقدم، تواجه الترجمة الآلية العديد من التحديات، مثل: صعوبة التعامل مع التعابير الاصطلاحية، وفهم السياق الثقافي للنصوص، وضبط نبرة الخطاب في النصوص المتخصصة بما يتناسب مع طبيعة اللغة المستهدفة[4]. ويسعى الباحثون في هذا المجال إلى معالجة هذه الإشكاليات عبر استخدام تقنيات متقدمة في معالجة اللغات الطبيعية، مثل: نماذج السياق العميق (Deep Contextual Models)، وآليات الانتباه (Attention Mechanisms)، والمحولات (Transformers)، إضافة إلى أسلوب
الضبط الدقيق (Fine-tuning) الذي يتيح تدريب النماذج على مجموعات بيانات متخصصة لتحسين أدائها في مجالات معينة كالطب أو القانون أو العلوم الدقيقة، وهو ما يسهم في رفع جودة الترجمة في النصوص المتخصصة.
مناهج الترجمة الآلية وتطورها
يعرض الشكل (1) تصنيفًا عامًا لتطور أنظمة الترجمة الآلية عبر المراحل المختلفة، ويظهر أربع فئات رئيسة لهذه الأنظمة، وهي:
الترجمة القائمة على القواعد (Rule-based Machine Translation)، والترجمة القائمة على الأمثلة (Example-based Machine Translation)، والترجمة الإحصائية (Statistical-based Machine Translation)، والترجمة المعتمدة على الشبكات العصبية (Neural-based Machine Translation)[5].
[الشكل 1]
تطور أساليب الترجمة الآلية وتصنيفها
حذف الصورة؟
سيؤدي هذا إلى نقل الصورة إلى سلة المهملات.
الترجمة القائمة على القواعد
تُعد هذه الطريقة من أقدم أساليب الترجمة الآلية وأضعفها (منذ خمسينيات القرن العشرين إلى ثمانينياته)، ويعتمد هذا الأسلوب على استخدام القواعد اللغوية والمعجمية (Linguistic and Lexical Rules) لترجمة النصوص، ويندرج تحتها ثلاثة نماذج رئيسة:
- الترجمة المباشرة (Direct Translation) وهي الترجمة الحرفية.
- الترجمة البينية (Interlingua-based Translation) التي تحول النص أولًا إلى لغة وسيطة مستقلة تُسمى "لغة محايدة" (Interlingua)، ثم يُترجم منها إلى اللغة الهدف.
- الترجمة المعتمدة على النقل (Transfer-based Translation)، وتعتمد على تحليل النص وفق قواعد اللغة المصدر، ثم نقله عبر قواعد تحويلية إلى اللغة الهدف.
الترجمة القائمة على الأمثلة
في هذا النهج الممتد بين التسعينيات وبداية الألفية الثالثة، استندت الترجمة إلى أوجه التشابه بين الجمل المتوازية في اللغة المصدر (Source Language) واللغة الهدف (Target Language). وكان هذا النهج أكثر فعالية من المنهج السابق، لكنه كان يتطلب كمية كبيرة من بيانات التدريب.
الترجمة الإحصائية
استند هذا النهج في العقد الأول من القرن الحادي والعشرين إلى نماذج إحصائية (Statistical Models)، تستخدم كميات كبيرة من البيانات ثنائية اللغة (Bilingual Data) لترجمة النصوص. وقد مثل ذلك تحسنًا كبيرًا، مقارنة بالمناهج السابقة، إذ اعتُمد على نطاق واسع في المجال الصناعي.
الترجمة الآلية العصبية
الترجمة الآلية العصبية -بدءًا من عام 2010- هي نظام يعتمد على
الشبكات العصبية العميقة (Deep Neural Networks) لترجمة النصوص بين اللغات. يُبنى النظام عبر تجميع بيانات ثنائية اللغة (Parallel Corpora) تحتوي على نصوص مترجمة بين اللغة المصدر واللغة الهدف، ثم تمر هذه البيانات بمرحلة المعالجة المسبقة (Preprocessing)، مثل: تعيين حدود الوحدات اللغوية في النصوص (Tokenization)، وترميز المكونات الأساسية للكلمات (Subword Encoding) لتقليل حجم المفردات والتعامل مع الكلمات النادرة أو غير الموجودة في بيانات التدريب. يستخدم النظام عادة بنية تعتمد على نماذج المرمّز/ مفكك الترميز (Encoder-Decoder Models) مع آلية الانتباه أو
الانتباه الذاتي (Self-Attention) كما يوجد ذلك في نموذج المحول. بعد التدريب على ملايين الجمل، يصبح النظام قادرًا على توليد الترجمة بشكل متسلسل عبر الاحتمالات السياقية (Contextual Probabilities). من بين الأنظمة المعتمدة على هذا:
غوغل ترانسليت (Google Translate) بعد عام 2016، وديب إل (DeepL)، ومايكروسوفت ترانزليتر (Microsoft Translator) بعد عام 2016، وياندكس ترانزليت (Yandex Translate) بعد عام 2017.
بين عامي 2014 و2017، ظهرت مرحلة الترجمة العصبية باستخدام
الشبكات العصبية التكرارية (Recurrent Neural Networks)، وذاكرة قصيرة المدى مطولة (Long Short Term Memory) لمعالجة النصوص بشكل تسلسلي. وشكل عام 2017 نقطة تحول رئيسة مع ظهور معمارية المحول عبر ورقة بحثية شهيرة بعنوان الانتباه
هو كل ما تحتاج إليه (Attention Is All You Need)[6]، التي أصبحت أساسًا لتطوير أنظمة الترجمة، مثل:
إم-بارت (mBART)[7]، وتي5 (T5)[8]. ومنذ عام 2020، ظهر الجيل الأول من النماذج متعددة اللغات، مثل:
إم-تي5 (mT5)[9]، وإم2إم-100 (M2M-100)[10]، إذ تعتمد على نموذج واحد لدعم لغات متعددة. ومنذ عام 2022، دخلت النماذج اللغوية الكبيرة مجال الترجمة بشكل أوسع، مع نماذج، مثل:
جي بي تي (GPT) من
أوبن إيه آي (OpenAI)[11]، وبالم (PaLM)[12]، وجِمِناي (Gemini) من
غوغل (Google)[13]، ولاما (LLaMA) من
ميتا
[14](Meta)، وميسترال (Mistral)[15] من
ميسترال إيه آي (Mistral AI)، إذ تعتمد هذه النماذج على بنية موحدة لمعالجة لغات وسياقات متعددة في نظام واحد.
تقييمها
التقييم في الترجمة الآلية هو عملية قياس مدى جودة النص المترجم بوساطة الآلة، ويتم ذلك من خلال مقارنته بترجمة بشرية مرجعية باستخدام مقاييس آلية (Automatic Metrics)، أو من خلال التقييم البشري (Human Evaluation) الذي يجريه لغويون ومتخصصون وخبراء في المجال المعني الذي يقيمون طلاقته، ودقته، ومدى ملاءمته النص الثقافي والسياقي. ويسهم التقييم في تحديد نقاط الضعف في أنظمة الترجمة الآلية وتحسين أدائها.
التقييم الآلي
تُعد مقاييس التقييم الآلي أدوات حاسوبية صُممت لقياس جودة الترجمات التي تنتجها الآلة بلا تدخل بشري[16]. وتستخدم هذه المقاييس خوارزميات لمقارنة الترجمة الآلية بالترجمات المرجعية، إذ تُسند درجات رقمية استنادًا إلى مجموعة من الخصائص اللغوية المختلفة.
يستخدم الباحثون مقاييس مختلفة مثل:
- معدل تحرير الترجمة (Translation Edit Rate- TER)[17]، وهو نسبة عدد التعديلات اللازمة لتحويل الترجمة الآلية إلى الترجمة المرجعية الصحيحة إلى عدد الكلمات في الترجمة المرجعية.
- معدل خطأ الكلمات (Word Error Rate- WER)[18]، وهو مقياس شائع الاستخدام في تقييم أنظمة التعرف على الكلام والترجمة الآلية، ويُحسب وفق المعادلة الآتية:
\[WER=\frac{S+D+I}{N}\]
بحيث تمثل (S) عدد الكلمات المستبدلة (Substitutions) وتمثل(D) عدد الكلمات المحذوفة (Deletions)، وتمثل (I) عدد الكلمات المضافة (Insertions)، وتمثل (N) العدد الكلي للكلمات في النص المرجعي.
- مقياس تقييم الترجمة مع الترتيب الصريح (Metric for Evaluation of Translation with Explicit ORdering- METEOR)[19]، ويُستخدم لتقييم جودة الترجمات الآلية من خلال مقارنة الترجمة الناتجة عن النظام بالترجمة المرجعية. يتميز هذا المقياس بقدرته على تحقيق المطابقة على مستوى الكلمات، إذ لا يقتصر على المطابقة الحرفية فحسب، بل يدعم أيضًا مطابقة المرادفات، كذلك يستخدم تقنية
التجذيع (Stemming) لمعالجة الاختلافات الصرفية في الكلمات. بالإضافة إلى ذلك، يقيم المقياس مدى التقارب في ترتيب الكلمات بين الترجمة الآلية والمرجعية، ويعتمد في حساب درجته النهائية على معادلة تجمع بين الإحكام (Precision) والاستدعاء (Recall) للحصول على قياس أكثر شمولية.
- مقياس التقييم الثنائي للترجمة-بلو (Bilingual Evaluation Understudy- BLEU)[20]، وهو أحد أكثر المقاييس شيوعًا في تقييم جودة الترجمات الآلية. يعتمد هذا المقياس على مقارنة الترجمة الناتجة عن النظام بالترجمات المرجعية المعتمدة، وذلك من خلال حساب درجة التطابق بينهما على مستوى العبارات القصيرة أو ما يُعرف بـ"ن-وحدة" (n-grams). يحسب هذا المقياس نسبة العبارات المتطابقة بين الترجمة الآلية والمرجعية، كذلك يستخدم آلية لتقليل
التحيز (Bias) نحو الترجمات القصيرة عبر ما يُعرف بـ"معامل العقوبة على الإيجاز" (Brevity Penalty). تُحسب الدرجة النهائية للمقياس على أنها ناتج متوسط هندسي لمستويات مختلفة من ن-وحدة، إذ تُعطى قيمة بين 0 و1، وكلما اقتربت النتيجة من 1 دَلّ ذلك على ارتفاع جودة الترجمة.
- المقياس المحسن متعدد اللغات لتقييم الترجمة-كوميت (Crosslingual Optimised Metric for Evaluation of Translation- COMET)[21]، وهو مقياس يعتمد على تقنيات التعلم العميق أي إنه يعتمد على نماذج تمثيل اللغة المعتمدة على المحولات، مثل
برت (BERT)[22]، إذ يمثل النص الأصلي والترجمة المرجعية والترجمة الآلية في فضاء دلالي موحد، ثم يقيس درجة التشابه بينها من منظور المعنى والسياق معًا.
- مقياس التقييم الثنائي للترجمة للغة العربية-بلو أل (Bilingual Evaluation Understudy for Arabic Language- AL-BLEU)[23]، وهو امتداد لمقياس
بلو (BLEU) وصُمم خصيصًا لمعالجة التحديات المرتبطة بتقييم الترجمات الآلية للغة العربية. يأخذ هذا المقياس بعين الاعتبار الطبيعة الصرفية الغنية والمعقدة للغة العربية، إذ يراعي الاختلافات في الجذور، والتصريفات، والبنية النحوية، لتوفير نتائج دقيقة عند مقارنة الترجمة الآلية بالترجمات المرجعية، وهو ما يجعله مناسبًا لتقييم الأنظمة الموجهة إلى اللغات ذات الخصائص الصرفية المعقدة، مثل اللغة العربية.
التقييم البشري
يتضمن التقييم البشري إجراء تقييم الترجمات التي تنتجها الآلة بوساطة محكمين بشريين، وغالبًا ما يكون هؤلاء المحكمون خبراء ثنائيي اللغة أو متعددي اللغات، إذ يقيمون الترجمات استنادًا إلى معايير، مثل: الطلاقة (Fluency)، والملاءمة (Adequacy)، ومدى الالتزام بالنص الأصلي[24]. ويوفر التقييم البشري منظورًا أكثر شمولية وحساسية للسياق (Context-Sensitivity)، إذ يلتقط الفروق الدقيقة التي قد تعجز مقاييس التقييم الآلي عن رصدها[25].
وتشمل هذه الفروق جوانب عديدة، مثل الملاءمة السياقية (Contextual Appropriateness)، إذ قد تنتج الترجمة الآلية كلمات صحيحة لغويًا لكنها لا تناسب المعنى المقصود في السياق، كما يحدث في ترجمة كلمة "bank" إلى "ضفة" بدلًا من "بنك" في نص اقتصادي. إضافة إلى ذلك، يراعي التقييم البشري الحساسية الثقافية (Cultural Sensitivity)، مثل ترجمة عبارة "breaking fast during Ramadan" إلى "الإفطار في رمضان" بدلًا من "كسر الصيام" التي قد تُعد غير مناسبة ثقافيًا.
كذلك يتميز التقييم البشري بقدرته على تقييم الأسلوب (Style) والنبرة (Tone)، إذ يمكنه التمييز بين اللغة المستعملة في المجال القانوني أو الديني أو الإعلام. علاوة على ذلك، يستطيع البشر معالجة الغموض الدلالي (Semantic Ambiguity) في الكلمات متعددة المعاني، مثل كلمة "charge" التي قد تعني "اتهامًا" أو "شحنًا" أو "رسومًا مالية" وفقًا للسياق. وأخيرًا، يُعد التقييم البشري أكثر قدرة على فهم التعابير الاصطلاحية (Idiomatic Expressions) والتراكيب البلاغية (Figurative Language)، مثل ترجمة العبارة الإنكليزية "it’s raining cats and dogs" إلى "إنها تمطر بغزارة" بدلًا من الترجمة الحرفية "إنها تمطر قططًا وكلابًا". وبناء على ذلك، طور الباحثون عددًا من هذه الأساليب والمقاييس المتنوعة، من أبرزها ما يلي:
- مقياس متعدد الأبعاد لجودة الترجمة[26] (Multidimensional Quality Metrics- MQM)[27]، الذي يمكن بوساطته تقييم الترجمة الآلية، والترجمة البشرية وكذلك الترجمة المولدة بوساطة الذكاء الاصطناعي (AI-Generated Translation). ويعمل هذا الإطار وفق نموذج احتساب الدرجات[28] (Scoring Model)، وتحديد مجموعة من أنواع الأخطاء (Error Types)، التي تُنظم في نظام هرمي[29] (Hierarchical System) يضم سبعة أبعاد أساسية رئيسة لهذه الأخطاء (Core Error Dimensions)، بالإضافة إلى الأنواع الفرعية لهذه للأخطاء (Subordinate Error Types)، ومستويات الشدة المرتبطة بها (Severity Levels)، وهي: محايد (Neutral)، وطفيف (Minor)، وجسيم (Major)، وحرج (Critical). ويتضمن نموذج احتساب الدرجات نظامًا للأوزان والمعامِلات (Weights and Parameters) يُخصص لأنواع الأخطاء ومستويات شدتها، إلى جانب صيغة حسابية (Scoring Formula) تُستخدم لاحتساب درجة رقمية تمثل جودة الترجمة المقيمة، وذلك من خلال إجمالي الجزاءات المطلقة (Absolute Penalty Total) وفقًا للمواصفات المتفق عليها وعدد الأخطاء (Error Counts).
- التقييم المباشر (Direct Assessment- DA)[30]، يقيس جودة الترجمة من 0 إلى 100، وذلك استنادًا إلى معايير الملاءمة (Adequacy) والطلاقة (Fluency) على مستوى الجملة. وللحصول على الدرجة، يُزود المحكمون البشريون بترجمة مرجعية (Reference Translation) إلى جانب مخرجات نظام ترجمة آلية واحد، وهو ما يجعل عملية التقييم أحادية اللغة. ولضمان قابلية إعادة الإنتاج (Reproducibility)، يتطلب هذا الأسلوب وجود عدد كبير من المحكمين، لا يقل عن 15 محكمًا. بالإضافة إلى ذلك، تُوحد الدرجات (Score Standardisation) للتخلص من التحيزات الفردية، مثل المحكمين الذين يمنحون درجات مرتفعة أو منخفضة بشكل متكرر. كذلك تُطبق آلية لضبط الجودة (Quality Control) بهدف استبعاد المحكمين الذين تظهر نتائجهم تباينًا مرتفعًا مقارنة ببقية المحكمين. وبشكل عام، يُعد أسلوب التقييم المباشر من أفضل الطرائق للحصول على أحكام بشرية موثوق بها، إذ ينتج درجة رقمية يمكن استخدامها بسهولة في الأساليب الإحصائية الشائعة، مثل:
معامل ارتباط سبيرمان (Spearman)، أو
معامل ارتباط بيرسون (Pearson)، سواء على مستوى المقطع النصي (Segment-level) أو على مستوى النظام كله (System-level). ومع ذلك، للحصول على قياسات ارتباط ذات دلالة إحصائية (Statistically Significant Correlation Measurements) وضمان قابلية إعادة النتائج، يتطلب هذا الأسلوب توفر عدد كبير من التقييمات البشرية.
- الاتفاق بين المقيّمين (Inter-Annotator Agreement- IAA)، يُعد مقياسًا إحصائيًا يُستخدم لقياس مدى الاتساق أو التوافق بين تقييمات مجموعة من المقيّمين عند الحكم على البيانات نفسها، مثل تقييم جودة الترجمات الآلية أو البشرية. ويُعتبر هذا المقياس عنصرًا أساسيًا في ضمان موثوقية التقييم البشري وصحة نتائجه؛ إذ إن ارتفاع مستوى الاتفاق يعكس وضوح المعايير المستخدمة وانخفاض التحيز في الأحكام. توجد عدة طرائق لقياس الاتفاق بين المقيّمين، من أبرزها
معامل كابا لكوهين (Cohen’s Kappa) عندما يوجد مقيّمان فقط، ومعامل كابا لفليس (Fleiss’ Kappa) عند وجود أكثر من مقيّميْن، إضافة إلى معاملات أخرى، مثل: معامل بيرسون (Pearson Correlation) لقياس الترابط بين الدرجات الرقمية، ومعامل كندال تاو (Kendall’s Tau) للتقييمات الرتبية. وكلما اقتربت قيمة الاتفاق من 1 دَل ذلك على قوة الاتساق بين المقيّمين، في حين تشير القيم القريبة من الصفر أو السالبة إلى ضعف الاتفاق أو انعدامه.
وعلى الرغم من استخدام المقاييس الآلية في تقييم الترجمة الآلية، فإن التقييم البشري غالبًا ما يُعتبر أكثر دقة لعدة أسباب. تعتمد المقاييس الآلية على خوارزميات محددة مسبقًا (Predefined Algorithms) لمقارنة الترجمات مع مجموعة من الترجمات المرجعية، وغالبًا ما تركز هذه الخوارزميات على تطابق الكلمات أو ن-وحدة (Word / n-gram Overlaps)، لكن هذه الأخيرة قد تعجز عن قياس جودة الترجمة بشكل شامل. وعلى خلاف ذلك، يتيح التقييم البشري إجراء تقييمات ذاتية لعوامل دقيقة يصعب قياسها آليًا، إذ يأخذ بعين الاعتبار الحفاظ على المعنى الدلالي، وسلامة القواعد النحوية، والملاءمة الثقافية، بالإضافة إلى التعامل مع النصوص المتخصصة والقدرة على التمييز بين مجالاتها المختلفة لضمان استخدام المصطلحات الدقيقة في السياق الصحيح. كذلك يتميز المقيّمون البشريون بقدرتهم على اكتشاف الأخطاء الدقيقة، مثل: التراكيب غير الطبيعية (Unnatural Phrasing)، أو عدم التوافق في النبرة (Tone Mismatch)، وهي معايير يصعب على المقاييس الآلية قياسها بدقة، وهو ما تدعمه دراسات سابقة[31].
الترجمة الآلية واللغة العربية
تُعد الترجمة الآلية في اللغة العربية مجالًا بحثيًا متناميًا، شهد تطورًا ملحوظًا من النماذج القائمة على القواعد والمعجمات إلى الأساليب الإحصائية ثم الشبكات العصبية العميقة، مع تركيز متزايد على معالجة الخصائص اللغوية الفريدة للعربية وتحدياتها الدلالية والنحوية. وقد سعت دراسات متعددة إلى تحسين أداء أنظمة الترجمة الآلية الموجهة إلى اللغة العربية.
اقتُرحت دراسة حول نموذج المورفولوجيا الكامنة، وهو منهج جديد في الترجمة العصبية يعتمد على أسلوب فك الترميز الهرمي القائم على المتغيرات الكامنة، لمحاكاة عمليتَي الاشتقاق والتصريف الصرفيين. ويولد النموذج الكلمات حرفًا حرفًا من خلال الجمع بين الجذور والخصائص الصرفية. وعند مقارنته بطرائق فك الترميز على مستوى المقاطع الجزئية (Subword) أو الأحرف، حقق تحسنًا طفيفًا بلغ 0.51 نقطة على مقياس
بلو (BLEU) في مهمة الترجمة من الإنكليزية إلى العربية[32].
كذلك قدمت دراسة أخرى نظامًا للتحويل الصوتي (Romanization) يهدف إلى معالجة مشكلة الكلمات غير المعروفة في الترجمة بين العربية والصينية، وذلك عبر تحويل النصوص العربية إلى مقاطع جزئية. أُجريت تجارب مكثفة باستخدام سيناريوهات متعددة للتجزئة، وأظهرت النتائج أن المنهجية المقترحة تسهم بفعالية في تحسين جودة الترجمة، إذ رفعت الأداء بما يصل إلى 4 نقاط
بلو (BLEU)[33].
في سياق دراسات الترجمة الآلية العصبية للنصوص العربية، تناولت دراسةٌ حول الحفاظ على المشاعر في ترجمة المراجعات العربية إشكاليةَ نقل البعد العاطفي بدقة بين اللغات. وقد اعتمدت الدراسة على المعالجة المسبقة للنصوص وإضافة إشارات سياقية في أثناء التدريب، مستخدمة نموذج المحول من نوع seq2seq، الذي يضم 12 طبقة للترميز و12 طبقة لفك الترميز. ونُفذت التجارب باستخدام منصة
فيرسيك (Fairseq)، بهدف تقييم قدرة النموذج على الحفاظ على الحمولة العاطفية للنصوص العربية في أثناء الترجمة الآلية[34].
ومن المبادرات الحديثة في مجال الموارد اللغوية الموجهة إلى الترجمة الآلية، ركزت دراسات أخرى[35] على الترجمة المتخصصة في المجال القانوني وما تواجهه من صعوبات عند التعامل مع اللغة العربية. فيشير الباحثون إلى أن أنظمة الترجمة الآلية كثيرًا ما تفشل في نقل المكافئ الدقيق للمصطلحات القانونية العربية إلى لغات أخرى، مثل: الإنكليزية والفرنسية، وذلك بسبب غياب الموارد المعجمية المهيكلة رقميًا وعدم كفاية المعرفة بالنظم القانونية المختلفة. لمعالجة هذا التحدي، يقترح البحث بناء قاموس قانوني متعدد اللغات وقابل للمعالجة الحاسوبية. وقد اعتمد المنهج على استخراج المصطلحات القانونية باستخدام قواعد
نوج (NooJ)، ثم تطوير قاعدة بيانات معجمية يمكن دمجها في تطبيقات الترجمة الآلية ومعالجة اللغة الطبيعية، بهدف تحسين دقة ترجمة النصوص القانونية العربية. أظهرت النتائج أن النظام حقق درجة إحكام (Precision) بلغت 0.91% واستدعاء (Recall) بمقدار 0.85%، وهو ما يعكس جودة عالية في عملية التعرف على المصطلحات ضمن النصوص القانونية العربية.
وفي هذا الاتجاه، برز مشروع
قبس (Qabas)[36] الذي طورته جامعة بيرزيت الفلسطينية، بوصفه معجمًا عربيًا مفتوح المصدر، صمم لدعم تطبيقات معالجة اللغة الطبيعية. يدمج قبس بيانات 110 معاجم و12 مدونة مشروحة صرفيًا، ويقدم قاعدة بيانات مترابطة تضم نحو 58 ألف صيغة معجمية وأكثر من 256 ألف علاقة ربط. يشمل المعجم توصيفًا صرفيًا متقدمًا كالنوع والعدد والجذر والزمن، ويُعد من أوسع الموارد العربية المتاحة مقارنة بقواعد بيانات سابقة، مثل
سما (SAMA)[37]. أظهرت عمليات التقييم أن تغطيته شملت 99 في المئة من محتوى سما وكامل معجم
مودرن (Modern)[38]، مع تحقيق مستوًى عالٍ من الاتفاق بين المحررين (κ ≈ 0.85-0.88)، وهو ما يعكس جودة الربط ودقة التوصيف. يمثل قبس خطوة مهمة نحو إتاحة موارد معجمية عربية مفتوحة المصدر يمكن إعادة استخدامها في تطوير أنظمة الترجمة الآلية والتطبيقات اللغوية الأخرى.
تناول بحث مشروع
بالم (PALM)[39] إنشاء أول مجموعة بيانات تعليمية شاملة، تُنشأ يدويًا لتدريب النماذج اللغوية الكبيرة الخاصة بالعربية وتقييمها بطريقة ثقافية شاملة ولغوية متنوعة. يغطي المشروع 22 دولة عربية ويضم أكثر من 17 ألف زوج من التعليمات والاستجابات المكتوبة بالعربية الفصحى والعاميات المحلية عبر 20 مجالًا متنوعًا كالتاريخ، والأمثال، والأعياد، والسياسة. استُخدمت هذه البيانات لتقييم نماذج متقدمة، مثل:
جي بي تي-4 أو (GPT-4o)، وكلود-3.5 (Claude-3.5)، وسونيت (Sonnet) وكوين 2.5 (Qwen 2.5)، إذ أظهرت النتائج أن النماذج الكبيرة تتفوق في الاتساق اللغوي (91%) لكنها ما زالت محدودة في الاتساق اللهجي (أقل من 10%). كذلك كشف التقييم أن الأداء يختلف باختلاف الدولة واللهجة، مع نتائج أعلى لمصر وتونس، وأقل لفلسطين والمغرب. وقد أكد التقييم البشري هذه النتائج، وهو ما يبرز أهمية بالم باعتبارها أداة مرجعية لتطوير نماذج أكثر إدراكًا للتنوع الثقافي واللغوي العربي.
تواجه الترجمة الآلية في اللغة العربية مجموعة من التحديات المتشابكة التي تجعل تطوير أنظمة دقيقة وفعّالة مهمة معقدة[40]، فمن جهة، يبرز التعقيد الصرفي والنحوي الذي تتميز به العربية نتيجة غناها بالاشتقاقات والجذور واللواحق والحركات، وهو ما يؤدي إلى تباين واسع في الأشكال الممكنة للكلمة الواحدة وصعوبة في معالجتها مقارنة بلغات أخرى[41]. كذلك يشكل الغموض الدلالي تحديًا أساسيًا، إذ إن كثيرًا من الكلمات تحمل معاني متعددة لا يُفهم المقصود منها إلا في ضوء السياق، وهو ما يجعل الترجمة عرضة للأخطاء[42]. وتُضاف إلى ذلك الفجوة بين الفصحى واللهجات، إذ تركز معظم الأنظمة على النصوص بالفصحى الحديثة في حين يشيع استخدام اللهجات في الحياة اليومية والإعلام، وهو الأمر الذي يؤدي إلى ضعف الأداء عند التعامل مع النصوص العامية[43]. كذلك تسهم ندرة الموارد المتخصصة وغياب المعاجم الرقمية المهيكلة في المجالات العلمية أو القانونية في الحد من جودة الترجمة في هذه القطاعات[44]. ويعاني المجال أيضًا البيانات غير المتوازنة، إذ إن كثيرًا من المدونات الموازية العربية-الإنكليزية تفتقر إلى التغطية الكافية أو التوازن المطلوب، وهو ما يؤثر في تدريب النماذج العصبية. إلى جانب ذلك، غالبًا ما تهمل الأنظمة التمثيل الثقافي والسياقي، فتفشل في نقل التعبيرات الاصطلاحية والخصوصيات الثقافية بدقة، فضلًا عن وجود مشكلات تقنية مرتبطة بتمثيل النصوص العربية، مثل: اتجاه الكتابة من اليمين إلى اليسار، وصعوبات التشكيل، والتباين في طرائق الكتابة أو النطق[45].
مستقبل الترجمة الآلية في اللغة العربية
ترتبط آفاق تطوير الترجمة الآلية للغة العربية بالتقدم في النماذج اللغوية الكبيرة والشبكات العصبية العميقة، وبالسعي إلى تحسين معالجة الخصائص الصرفية والنحوية والدلالية للعربية. وتشمل هذه الاتجاهات تطوير موارد لغوية أكثر غنًى، مثل المعجمات المترابطة والمدونات متعددة اللهجات، بهدف تحسين تمثيل التنوع اللغوي العربي داخل أنظمة الترجمة الآلية[46]. إضافة إلى ذلك، تتجه تطبيقات الترجمة الآلية إلى التكامل مع أنظمة الذكاء الاصطناعي التفاعلي، مثل: المساعدات الذكية، ومنصات التعليم. إضافة إلى دعم المجالات المتخصصة كالقانون، والطب، والتعليم، والعلوم، من خلال تطوير موارد ومعجمات مصطلحية دقيقة[47].
وتعكس هذه الاتجاهات تحول البحث في الترجمة الآلية العربية من التركيز على الدقة اللغوية وحدها إلى تطوير أنظمة أكثر قدرة على تمثيل السياقين اللغوي والثقافي، والتعامل مع الاستخدامات العامة والمتخصصة.
[1] Khadija Ait ElFqih & Johanna Monti, “Large Language Models as Legal Translators of Arabic Legislatives: Does ChatGPT and Gemini Care for Context and Terminology?” in: Nizar Habash et al. (eds.), Proceedings of the Second Arabic Natural Language Processing Conference (Bangkok, Thailand: Association for Computational Linguistics, 2024), pp. 111–122.
[2] Khadija Ait ElFqih & Johanna Monti, “On the Evaluation of Terminology Translation Errors in NMT and PB-SMT in the Legal Domain: A Study on the Translation of Arabic Legal Documents into English and French,” in: Amal Haddad Haddad et al. (eds.),
Proceedings of the Workshop on Computational Terminology in NLP and Translation Studies (ConTeNTS) Incorporating the 16th Workshop on Building and Using Comparable Corpora (BUCC) (Varna, Bulgaria: INCOMA Ltd., Shoumen, Bulgaria, 2023), pp. 26–35.
[3] Sanjun Sun, Kanglong Liu & Riccardo Moratto (eds.),
Translation Studies in the Age of Artificial Intelligence (London: Routledge, 2025).
[4] Khadija Ait ElFqih, Maria Pia Di Buono & Johanna Monti, “Towards a Linguistic Annotation of Arabic Legal Texts: A Multilingual Electronic Dictionary for Arabic,” in: International Conference on Automatic Processing of Natural-Language Electronic Texts with NooJ (Cham: Springer Nature Switzerland, 2023), pp. 51–63; Fakhraddin Alwajih et al., “Palm: A Culturally Inclusive and Linguistically Diverse Dataset for Arabic LLMs,” in: Wanxiang Che et al. (eds.),
Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), (Vienna, Austria: Association for Computational Linguistics, 2025); Jeffrey Killman, “Vocabulary Accuracy of Statistical Machine Translation in the Legal Context,” in: Sharon O'Brien, Michel Simard & Lucia Specia (eds.),
Proceedings of the 11th Conference of the Association for Machine Translation in the Americas (Vancouver, Canada: Association for Machine Translation in the Americas, 2014), pp. 85–98; Jezia Zakraoui et al., “Arabic Machine Translation: A Survey with Challenges and Future Directions,” IEEE Access, vol. 9 (2021), pp. 161445–161468.
[5] Philipp Koehn, Statistical Machine Translation (Cambridge: Cambridge University Press, 2010).
[6] Ashish Vaswani et al., “Attention Is All You Need,” in: Ulrike von Luxburg et al. (eds.),
Advances in Neural Information Processing Systems 30 (NIPS 2017) (California, USA: Curran Associates, Inc., 2017).
[7] Yinhan Liu et al., “Multilingual Denoising Pre-training for Neural Machine Translation,”
arXiv, 22/1/2020, accessed on 19/7/2026, at: https://acr.ps/hBybGtP
[8] Colin Raffel et al., “Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer,”
The Journal of Machine Learning Research, vol. 21, no. 1 (2019), pp. 5485–5551.
[9] Linting Xue et al., “mT5: A Massively Multilingual Pre-Trained Text-to-Text Transformer,” in: Kristina Toutanova et al. (eds.),
Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Association for Computational Linguistics, 2021), pp. 483–498.
[10] Angela Fan et al., “Beyond English-Centric Multilingual Machine Translation,”
The Journal of Machine Learning Research, vol. 22, no. 1 (2020), pp. 4839–4886.
[11] Tom B. Brown et al., “Language Models Are Few-Shot Learners,”
arXiv, 28/5/2020, accessed on 19/7/2026, at: https://acr.ps/hBybGUy
[12] Aakanksha Chowdhery et al., “PaLM: Scaling Language Modeling with Pathways,”
arXiv, 5/4/2022, accessed on 19/7/2026, at: https://acr.ps/hBybHlh
[13] Rohan Anil et al., “Gemini: A Family of Highly Capable Multimodal Models,”
arXiv, 19/12/2023, accessed on 19/7/2026, at: https://acr.ps/hBybGGr
[14] Hugo Touvron et al., “LLaMA: Open and Efficient Foundation Language Models,”
arXiv, 27/2/2023, accessed on 19/7/2026, at:
https://acr.ps/hBybHmM
[15] Albert Qiaochu Jiang et al., “Mistral 7B,”
arXiv, 10/10/2023, accessed on 19/7/2026, at:
https://acr.ps/hBybGHW
[16] Kishore Papineni et al., “BLEU: A Method for Automatic Evaluation of Machine Translation,” in: Pierre Isabelle, Eugene Charniak & Dekang Lin (eds.),
Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics (Philadelphia, Pennsylvania, USA: Association for Computational Linguistics, 2002), pp. 311–318.
[17] Matthew Snover et al., “A Study of Translation Edit Rate with Targeted Human Annotation,” in:
Proceedings of the 7th Conference of the Association for Machine Translation in the Americas: Technical Papers (Cambridge, Massachusetts, USA: Association for Machine Translation in the Americas, 2006), pp. 223–231.
[18] Ahmed M. Ali & Steve Renals, “Word Error Rate Estimation for Speech Recognition: e-WER,” in: Iryna Gurevych & Yusuke Miyao (eds.),
Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Melbourne, Australia: Association for Computational Linguistics, 2018), pp. 20–24.
[19] Alon Lavie & Michael J. Denkowski, “The METEOR Metric for Automatic Evaluation of Machine Translation,” Machine Translation, vol. 23 (2009), pp. 105–115.
[20] Papineni et al.,
op. cit.
[21] Ricardo Rei et al., “COMET: A Neural Framework for MT Evaluation,”
arXiv, 18/9/2020, accessed on 19/7/2026, at: https://acr.ps/hBybH8F
[22] Jacob Devlin et al., “BERT: Pre-Training of Deep Bidirectional Transformers for Language Understanding,” in: Jill Burstein, Christy Doran & Thamar Solorio (eds.),
Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers) (Minneapolis, Minnesota: Association for Computational Linguistics, 2019), pp. 4171–4186.
[23] Houda Bouamor et al., “A Human Judgement Corpus and a Metric for Arabic MT Evaluation,” in: Alessandro Moschitti, Bo Pang & Walter Daelemans (eds.),
Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP) (Doha, Qatar: Association for Computational Linguistics, 2014), pp. 207–213.
[24] ElFqih & Monti, “Large Language Models as Legal Translators of Arabic Legislatives: Do ChatGPT and Gemini Care for Context and Terminology?”
[25] Lucia Comparin, & Sara Mendes. “Using Error Annotation to Evaluate Machine Translation and Human Post-Editing in a Business Environment,” paper presented at 20th Annual Conference of the European Association for Machine Translation, EAMT. Czech Republic, Prague, 29-31/05/2017.
[26] “What Is MQM?”
Multidimensional Quality Metrics (MQM), accessed on 19/7/2026, at:
https://acr.ps/hBybGJr
[27] Aljoscha Burchardt, “Multidimensional Quality Metrics: A Flexible System for Assessing Translation Quality,”
in:
Proceedings of Translating and the Computer 35 (London: Aslib, 2013).
[28] “The MQM Scoring Model,”
Multidimensional Quality Metrics (MQM), accessed on 19/7/2026, at:
https://acr.ps/hBybGvk
[29] “The MQM Error Typology,”
Multidimensional Quality Metrics (MQM), accessed on 19/7/2026, at:
https://acr.ps/hBybGW3
[30] Yvette Graham et al., “Improving Evaluation of Document-Level Machine Translation Quality Estimation,” in: Mirella Lapata, Phil Blunsom & Alexander Koller (eds.), Proceedings of the 15th Conference of the European Chapter of the Association for Computational Linguistics: Volume 2, Short Papers (Valencia, Spain: Association for Computational Linguistics, 2017), pp. 356–361.
[31] Mirjam Sepesy Maučec & Gregor Donaj, “Machine Translation and the Evaluation of Its Quality,” in: Ali Sadollah & Tilendra Shishir Sinha (eds.), Recent Trends in Computational Intelligence (London: IntechOpen, 2019); Elpida Loupaki, “EU Legal Language and Translation: Dehumanizing the Refugee Crisis,” International Journal of Language & Law, vol. 7 (2018), pp. 97–116; Killman,
op. cit.; Zakraoui et al.,
op. cit.; Rejwanul Haque, Mohammed Hasanuzzaman & Andy Way, “Analysing Terminology Translation Errors in Statistical and Neural Machine Translation,” Machine Translation, vol. 34 (2020), pp. 149–195; Rejwanul Haque, Mohammed Hasanuzzaman & Andy Way, “Investigating Terminology Translation in Statistical and Neural Machine Translation: A Case Study on English-to-Hindi and Hindi-to-English,” in: Ruslan Mitkov & Galia Angelova (eds.),
Proceedings of the International Conference on Recent Advances in Natural Language Processing (RANLP 2019) (Varna, Bulgaria: INCOMA Ltd., 2019), pp. 437–446; Vilém Zouhar & Ondřej Bojar, “Quality and Quantity of Machine Translation References for Automatic Metrics,”
arXiv, 2/1/2024, accessed on 19/7/2026, at:
https://acr.ps/hBybHaa
[32] Duygu Ataman, Wilker Aziz & Alexandra Birch, “A Latent Morphology Model for Open-Vocabulary Neural Machine Translation,”
arXiv, 30/10/2019, accessed on 19/7/2026, at: https://acr.ps/hBybH7a
[33] Fares Aqlan et al., “Arabic–Chinese Neural Machine Translation: Romanized Arabic as Subword Unit for Arabic-Sourced Translation,” IEEE Access, vol. 7 (2019), pp. 133122–133135.
[34] Hadeel Saadany & Constantin Orasan, “Is It Great or Terrible? Preserving Sentiment in Neural Machine Translation of Arabic Reviews,” in: Imed Zitouni et al. (eds.), Proceedings of the Workshop on Arabic Natural Language Processing (Barcelona, Spain: Association for Computational Linguistics, 2020), pp. 24–37.
[35] ElFqih, Di Buono & Monti,
op. cit.
[36] Mustafa Jarrar & Tymaa Hammouda, “Qabas: An Open-Source Arabic Lexicographic Database,” in: Nicoletta Calzolari et al. (eds.),
Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024) (Torino, Italia: ELRA and ICCL, 2024), pp. 13363–13370.
[37] Mohamed Maamouri et al., LDC Standard Arabic Morphological Analyzer (SAMA) Version 3.1 (Philadelphia: Linguistic Data Consortium LDC, 2009).
[38] أحمد مختار عبد الحميد عمر،
معجم اللغة العربية المعاصرة (القاهرة: عالم الكتب، 2008).
[39] Alwajih et al., “Palm: A Culturally Inclusive and Linguistically Diverse Dataset for Arabic LLMs.”
[40] Fatima Zahra El Idrysy et al., “Unlocking the Language Barrier: A Journey through Arabic Machine Translation,” Multimedia Tools and Applications, vol. 84 (2025), pp. 14071–14104.
[41] Faisal Alamri, “Improve Arabic–English Translation Using Arabic Language Attention Transformer,” Data Technologies and Applications, vol. 60, no. 1 (2026), pp. 192–217.
[42] Walaa A. S. Alahtam, Mohamed M. Tohamy & Hatem S. Saleh, “Challenges of Lexical and Syntactic Ambiguity in English-Arabic Translation of International Commercial Arbitration,”
Degrés, vol. 10, no. 4 (2025), p. 124; Yan Qin, “Semantic Role Labeling in Neural Machine Translation: Addressing Polysemy and Ambiguity Challenges,” Journal of Technology Informatics and Engineering (JTIE), vol. 4, no. 1 (2025), pp. 21–40.
[43] Abdullah Alabdullah, Lifeng Han & Chenghua Lin, “Advancing Dialectal Arabic to Modern Standard Arabic Machine Translation,”
arXiv, 27/7/2025, accessed on 19/7/2026, at:
https://acr.ps/hBybGT3
[44] Abdelhadi Soudi, Rabih Zbib, Günter Neumann & Ali Farghaly (eds.),
Challenges for Arabic Machine Translation, Natural Language Processing (Amsterdam: John Benjamins Publishing Company, 2012).
[45] Khadija Ait ElFqih, “Addressing Machine Translation of Legal Terminology in Arabic Legislation: From Error Evaluation to Systems Optimisation,” PhD Dissertation, University of Naples “L’Orientale”, Naples, 2025.
[46] Fakhraddin Alwajih et al., “Pearl: A Multimodal Culturally-Aware Arabic Instruction Dataset,”
arXiv, 28/5/2025, accessed on 19/7/2026, at: https://acr.ps/hBybHjM; Alwajih et al., “Palm: A Culturally Inclusive and Linguistically Diverse Dataset for Arabic LLMs”; Nagham Hamad, Mohammed Khalilia & Mustafa Jarrar, “Konooz: Multi-domain Multi-dialect Corpus for Named Entity Recognition.” In: Wanxiang Che et al. (eds.).
Findings of the Association for Computational Linguistics: ACL (Vienna, Austria: Association for Computational Linguistics, 2025), pp. 7316–7331.
[47] Rahul Raja & Arpita Vats, “Parallel Corpora for Machine Translation in Low-Resource Indic Languages: A Comprehensive Review,” in: Proceedings of the Eighth Workshop on Technologies for Machine Translation of Low-Resource Languages (LoResMT 2025) (Albuquerque, New Mexico, USA: Association for Computational Linguistics, 2025), pp. 129–143; Rachel Bawden et al., “MaTOS: Machine Translation for Open Science,” in: Pierrette Bouillon et al. (eds.), Proceedings of Machine Translation Summit XX: Volume 2 (Geneva, Switzerland: European Association for Machine Translation, 2025), pp. 103–104; Sun et al.,
op. cit.
المراجع
العربية
عمر، أحمد مختار عبد الحميد.
معجم اللغة العربية المعاصرة. القاهرة: عالم الكتب، 2008.
الأجنبية
Alabdullah, Abdullah, Lifeng Han & Chenghua Lin. “Advancing Dialectal Arabic to Modern Standard Arabic Machine Translation.”
arXiv. 27/7/2025. at:
https://acr.ps/hBybGT3
Alahtam, Walaa A. S., Mohamed M. Tohamy & Hatem S. Saleh. “Challenges of Lexical and Syntactic Ambiguity in English-Arabic Translation of International Commercial Arbitration.”
Degrés. vol. 10, no. 4 (2025). pp. 124-134.
Alamri, Faisal. “Improve Arabic–English Translation Using Arabic Language Attention Transformer.” Data Technologies and Applications. vol. 60, no. 1 (2026). pp. 192–217.
Ali, Ahmed M. & Steve Renals. “Word Error Rate Estimation for Speech Recognition: e-WER.” In: Iryna Gurevych & Yusuke Miyao (eds.).
Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics. Melbourne, Australia: Association for Computational Linguistics, 2018.
Alwajih, Fakhraddin et al. “Palm: A Culturally Inclusive and Linguistically Diverse Dataset for Arabic LLMs.” In: Wanxiang Che et al. (eds.).
Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Vienna, Austria: Association for Computational Linguistics, 2025.
Alwajih, Fakhraddin et al. “Pearl: A Multimodal Culturally-Aware Arabic Instruction Dataset.”
arXiv. 28/5/2025. at:
https://acr.ps/hBybHjM
Anil, Rohan et al. “Gemini: A Family of Highly Capable Multimodal Models.”
arXiv. 19/12/2023. at: https://acr.ps/hBybGGr
Aqlan, Fares et al. “Arabic–Chinese Neural Machine Translation: Romanized Arabic as Subword Unit for Arabic-Sourced Translation.” IEEE Access. vol. 7 (2019). pp. 133122–133135.
Ataman, Duygu, Wilker Aziz & Alexandra Birch. “A Latent Morphology Model for Open-Vocabulary Neural Machine Translation.”
arXiv. 30/10/2019. at: https://acr.ps/hBybH7a
Bawden, Rachel et al. “MaTOS: Machine Translation for Open Science.” In: Pierrette Bouillon et al. (eds.). Proceedings of Machine Translation Summit XX: Volume 2. Geneva, Switzerland: European Association for Machine Translation, 2025.
Bouamor, Houda et al. “A Human Judgement Corpus and a Metric for Arabic MT Evaluation.” In: Alessandro Moschitti, Bo Pang & Walter Daelemans (eds.).
Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP). Doha, Qatar: Association for Computational Linguistics, 2014.
Brown, Tom B. et al. “Language Models Are Few-Shot Learners.”
arXiv. 28/5/2020. at: https://acr.ps/hBybGUy
Burchardt, Aljoscha. “Multidimensional Quality Metrics: A Flexible System for Assessing Translation Quality.” In:
Proceedings of Translating and the Computer 35. London: Aslib, 2013.
Chowdhery, Aakanksha et al. “PaLM: Scaling Language Modeling with Pathways.”
arXiv. 5/4/2022. at: https://acr.ps/hBybHlh
Comparin, Lucia. & Sara Mendes. “Using Error Annotation to Evaluate Machine Translation and Human Post-Editing in a Business Environment.” paper presented at 20th Annual Conference of the European Association for Machine Translation, EAMT. Czech Republic, Prague, 29-31/05/2017.
Devlin, Jacob et al. “BERT: Pre-Training of Deep Bidirectional Transformers for Language Understanding.” In: Jill Burstein, Christy Doran & Thamar Solorio (eds.).
Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers). Minneapolis, Minnesota: Association for Computational Linguistics, 2019.
ElFqih, Khadija Ait & Johanna Monti. “On the Evaluation of Terminology Translation Errors in NMT and PB-SMT in the Legal Domain: A Study on the Translation of Arabic Legal Documents into English and French.” In: Amal Haddad Haddad et al. (eds.).
Proceedings of the Workshop on Computational Terminology in NLP and Translation Studies (ConTeNTS) Incorporating the 16th Workshop on Building and Using Comparable Corpora (BUCC). Varna, Bulgaria: INCOMA Ltd., Shoumen, Bulgaria, 2023.
________, Maria Pia Di Buono & Johanna Monti. “Towards a Linguistic Annotation of Arabic Legal Texts: A Multilingual Electronic Dictionary for Arabic.” In: International Conference on Automatic Processing of Natural-Language Electronic Texts with NooJ. Cham: Springer Nature Switzerland, 2023.
________ & Johanna Monti. “Large Language Models as Legal Translators of Arabic Legislatives: Does ChatGPT and Gemini Care for Context and Terminology?” In: Nizar Habash et al. (eds.). Proceedings of the Second Arabic Natural Language Processing Conference. Bangkok, Thailand: Association for Computational Linguistics, 2024.
________. “Addressing Machine Translation of Legal Terminology in Arabic Legislation: From Error Evaluation to Systems Optimisation.” PhD Dissertation, University of Naples “L’Orientale.” Naples, 2025.
El Idrysy, Fatima Zahra et al. “Unlocking the Language Barrier: A Journey through Arabic Machine Translation.” Multimedia Tools and Applications. vol. 84 (2025). pp. 14071–14104.
Fan, Angela et al. “Beyond English-Centric Multilingual Machine Translation.”
The Journal of Machine Learning Research. vol. 22, no. 1 (2020). pp. 4839–4886.
Graham, Yvette et al. “Improving Evaluation of Document-Level Machine Translation Quality Estimation.” In: Mirella Lapata, Phil Blunsom & Alexander Koller (eds.). Proceedings of the 15th Conference of the European Chapter of the Association for Computational Linguistics: Volume 2, Short Papers. Valencia, Spain: Association for Computational Linguistics, 2017.
Haque, Rejwanul, Mohammed Hasanuzzaman & Andy Way. “Investigating Terminology Translation in Statistical and Neural Machine Translation: A Case Study on English-to-Hindi and Hindi-to-English.” In: Ruslan Mitkov & Galia Angelova (eds.).
Proceedings of the International Conference on Recent Advances in Natural Language Processing (RANLP 2019). Varna, Bulgaria: INCOMA Ltd., 2019.
________. “Analysing Terminology Translation Errors in Statistical and Neural Machine Translation.” Machine Translation. vol. 34 (2020). pp. 149–195.
Hamad, Nagham. Mohammed Khalilia & Mustafa Jarrar. “Konooz: Multi-domain Multi-dialect Corpus for Named Entity Recognition.” In: Wanxiang Che et al. (eds.). Findings of the Association for Computational Linguistics: ACL. Vienna, Austria: Association for Computational Linguistics, 2025.
Jarrar, Mustafa & Tymaa Hammouda. “Qabas: An Open-Source Arabic Lexicographic Database.” In: Nicoletta Calzolari et al. (eds.).
Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024). Torino, Italia: ELRA and ICCL, 2024.
Jiang, Albert Qiaochu et al. “Mistral 7B.”
arXiv. 10/10/2023. at: https://acr.ps/hBybGHW
Killman, Jeffrey. “Vocabulary Accuracy of Statistical Machine Translation in the Legal Context.” In: Sharon O'Brien, Michel Simard & Lucia Specia (eds.).
Proceedings of the 11th Conference of the Association for Machine Translation in the Americas. Vancouver, Canada: Association for Machine Translation in the Americas, 2014.
Koehn, Philipp. Statistical Machine Translation. Cambridge: Cambridge University Press, 2010.
Lavie, Alon & Michael J. Denkowski. “The METEOR Metric for Automatic Evaluation of Machine Translation.” Machine Translation. vol. 23 (2009). pp. 105–115.
Liu, Yinhan et al. “Multilingual Denoising Pre-training for Neural Machine Translation.”
arXiv. 22/1/2020. at: https://acr.ps/hBybGtP
Loupaki, Elpida. “EU Legal Language and Translation: Dehumanizing the Refugee Crisis.” International Journal of Language & Law. vol. 7 (2018). pp. 97–116.
Maamouri, Mohamed et al. LDC Standard Arabic Morphological Analyzer (SAMA) Version 3.1. Philadelphia: Linguistic Data Consortium LDC, 2009.
Maučec, Mirjam Sepesy & Gregor Donaj. “Machine Translation and the Evaluation of Its Quality.” In: Ali Sadollah & Tilendra Shishir Sinha (eds.). Recent Trends in Computational Intelligence. London: IntechOpen, 2019.
"Machine Translation in AI,” GeeksforGeeks, last modified July 23, 2025, accessed on 17/05/2026, at: https://acr.ps/hBybHwo
Papineni, Kishore et al. “BLEU: A Method for Automatic Evaluation of Machine Translation.” In: Pierre Isabelle, Eugene Charniak & Dekang Lin (eds.). Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics. Philadelphia, Pennsylvania, USA: Association for Computational Linguistics, 2002.
Qin, Yan. “Semantic Role Labeling in Neural Machine Translation: Addressing Polysemy and Ambiguity Challenges.” Journal of Technology Informatics and Engineering (JTIE). vol. 4, no. 1 (2025). pp. 21–40.
Raffel, Colin et al. “Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.”
The Journal of Machine Learning Research. vol. 21, no. 1 (2019). pp. 5485–5551.
Raja, Rahul & Arpita Vats. “Parallel Corpora for Machine Translation in Low-Resource Indic Languages: A Comprehensive Review.” In: Proceedings of the Eighth Workshop on Technologies for Machine Translation of Low-Resource Languages (LoResMT 2025). Albuquerque, New Mexico, USA: Association for Computational Linguistics, 2025.
Rei, Ricardo et al. “COMET: A Neural Framework for MT Evaluation.”
arXiv. 18/9/2020. at:
https://acr.ps/hBybH8F
Saadany, Hadeel & Constantin Orasan. “Is It Great or Terrible? Preserving Sentiment in Neural Machine Translation of Arabic Reviews.” In: Imed Zitouni et al. (eds.). Proceedings of the Workshop on Arabic Natural Language Processing. Barcelona, Spain: Association for Computational Linguistics, 2020.
Soudi, Abdelhadi, Rabih Zbib, Günter Neumann & Ali Farghaly (eds.).
Challenges for Arabic Machine Translation, Natural Language Processing. Amsterdam: John Benjamins Publishing Company, 2012.
Snover, Matthew et al. “A Study of Translation Edit Rate with Targeted Human Annotation.” In:
Proceedings of the 7th Conference of the Association for Machine Translation in the Americas: Technical Papers. Cambridge, Massachusetts, USA: Association for Machine Translation in the Americas, 2006.
Sun, Sanjun, Kanglong Liu & Riccardo Moratto (eds.).
Translation Studies in the Age of Artificial Intelligence. London: Routledge, 2025.
“The MQM Scoring Model.”
Multidimensional Quality Metrics (MQM). at:
https://acr.ps/hBybGvk
“The MQM Error Typology.”
Multidimensional Quality Metrics (MQM). at:
https://acr.ps/hBybGW3
Touvron, Hugo et al. “LLaMA: Open and Efficient Foundation Language Models.”
arXiv. 27/2/2023. at:
https://acr.ps/hBybHmM
Vaswani, Ashish et al., “Attention Is All You Need.” In: Ulrike von Luxburg et al. (eds.).
Advances in Neural Information Processing Systems 30 (NIPS 2017). California, USA: Curran Associates, Inc., 2017.
“What Is MQM?”
Multidimensional Quality Metrics (MQM). at:
https://acr.ps/hBybGJr Xue, Linting et al. “mT5: A Massively Multilingual Pre-Trained Text-to-Text Transformer.” In: Kristina Toutanova et al. (eds.).
Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. Association for Computational Linguistics, 2021.
Zakraoui, Jezia et al. “Arabic Machine Translation: A Survey with Challenges and Future Directions.” IEEE Access.
vol. 9 (2021). pp. 161445–161468.
Zouhar, Vilém & Ondřej Bojar. “Quality and Quantity of Machine Translation References for Automatic Metrics.”
arXiv. 2/1/2024. at:
https://acr.ps/hBybHaa