التعرف على الكيانات المسماة هو أسلوب من أساليب معالجة اللغة الطبيعية (NLP) يُستخدم لاستخراج المعلومات الأساسية من النصوص غير المنظمة وتصنيفها، سواء كانت شخصًا أو مؤسسة أو مكانًا أو تاريخًا أو مبلغًا ماليًا. ويُعرف التعرف على الكيانات المسماة (NER) بأنه مهمة في معالجة اللغة الطبيعية تتمثل في تحديد "الكيانات المسماة" في النصوص غير المنظمة وتصنيفها ضمن فئات محددة مسبقًا. ويُعدّ مصطلح "التعرف على الكيانات المسماة" (NER) جوهر كيفية تحويل الآلات للغة الخام إلى بيانات منظمة وقابلة للاستخدام.
لماذا يُعدّ هذا الأمر مهمًا الآن؟ لأنّ القيمة الكامنة في النصوص تتزايد بشكلٍ هائل. بلغت قيمة سوق معالجة اللغات الطبيعية العالمي 59.70 مليار دولار أمريكي في عام 2024، ومن المتوقع أن تصل إلى 439.85 مليار دولار أمريكي بحلول عام 2030، بمعدل نمو سنوي مركب قدره 38.7% (بحسب مؤسسة جراند فيو للأبحاث، 2024) . يُعدّ التعرف على الكيانات المسمّاة أحد أهمّ العوامل الدافعة لهذا النمو، حيث يُشغّل محركات البحث، وبرامج الدردشة الآلية، وقنوات البيانات السريرية.
تخيّل تقنية التعرف على الكيانات المسماة (NER) كقلم تظليل يقوم بمهمتين في آن واحد: فهو يُعلّم الكلمات المهمة ويكتب ملاحظة في الهامش توضح معنى كل كلمة. يقوم الإنسان بذلك بشكل غريزي. فعند سماع اسم "ستيف جوبز"، يتبادر إلى ذهنك فورًا شخص، وشركة آبل، وكاليفورنيا. أما الحاسوب، فلا يمتلك هذه الغريزة، بل يحتاج إلى تدريب ليتعرف على هذه التصنيفات، وهذا التدريب هو أساس جودة البيانات.
الوجبات السريعة الرئيسية
- تحدد تقنية التعرف على الكيانات المسماة وتصنف الكيانات - الأشخاص والمنظمات والمواقع والتواريخ - في النص.
- "NER full form" تعني التعرف على الكيانات المسماة، وهي مهمة أساسية في معالجة اللغة الطبيعية.
- تعتمد تقنيات التعرف على الكيانات المسماة الحديثة في الغالب على التعلم العميق ونماذج المحولات مثل BERT.
- تحدد أنظمة الوسم مثل BIO و IOBES بداية ونهاية كل كيان.
- تعتمد جودة التعرف على الكيانات المسماة على بيانات تدريب عالية الجودة ومُعَلَّمة بشكل جيد.
- الاستخدامات الشائعة: البحث، وبرامج الدردشة الآلية، وسجلات الرعاية الصحية، والتمويل، والمراجعة القانونية.
ما هو التعرف على الكيانات المسماة (NER)؟
يُعدّ التعرّف على الكيانات المسماة جزءًا من معالجة اللغة الطبيعية. والهدف الرئيسي منه هو معالجة البيانات المنظمة وغير المنظمة وتصنيف هذه الكيانات المسماة إلى فئات محددة مسبقًا. تشمل بعض الفئات الشائعة الاسم، والموقع، والشركة، والوقت، والقيم النقدية، والأحداث، وغيرها.
باختصار ، يتعامل NER مع:
- التعرف على الكيان المسمى/الكشف عنه - تحديد كلمة أو سلسلة من الكلمات في مستند.
- تصنيف الكيان المسمى - تصنيف كل كيان تم اكتشافه إلى فئات محددة مسبقًا.
ولكن كيف يرتبط NER بـ NLP؟
تساعد معالجة اللغة الطبيعية في تطوير آلات ذكية قادرة على استخلاص المعنى من الكلام والنصوص. ويساعد التعلم الآلي هذه الأنظمة الذكية على مواصلة التعلم من خلال التدريب على كميات كبيرة من مجموعات بيانات اللغة الطبيعية.
بشكل عام ، يتكون البرمجة اللغوية العصبية من ثلاث فئات رئيسية:
- فهم هيكل وقواعد اللغة - بناء الجملة
- اشتقاق معاني الكلمات والنصوص والكلام وتحديد علاقاتهم - دلالات
- التعرف على الكلمات المنطوقة والتعرف عليها وتحويلها إلى نصوص - خطاب
يساعد NER في الجزء الدلالي من البرمجة اللغوية العصبية، واستخراج معنى الكلمات وتحديدها وتحديد موقعها بناءً على علاقاتها.
نظرة متعمقة على أنواع كيانات NER الشائعة
تصنف نماذج التعرف على الكيانات المسماة الكيانات إلى أنواع مختلفة محددة مسبقًا. يعد فهم هذه الأنواع أمرًا بالغ الأهمية للاستفادة من التعرف على الكيانات المسماة بشكل فعال. فيما يلي نظرة عن قرب على بعض الأنواع الأكثر شيوعًا:
- الشخص (PER): يحدد أسماء الأفراد، بما في ذلك الاسم الأول والأوسط والأخير والألقاب والألقاب الفخرية. على سبيل المثال: نيلسون مانديلا، الدكتورة جين دو
- المنظمة (ORG): يتعرف على الشركات والمؤسسات والهيئات الحكومية والمجموعات المنظمة الأخرى. على سبيل المثال: جوجل، منظمة الصحة العالمية، الأمم المتحدة
- الموقع (LOC): يكتشف المواقع الجغرافية، بما في ذلك البلدان والمدن والولايات والعناوين والمعالم. على سبيل المثال: لندن، جبل إيفرست، تايمز سكوير
- التاريخ (التاريخ): يستخرج التواريخ بتنسيقات مختلفة. مثال: 1 يناير 2024، 2024-01-01
- التوقيت): يحدد تعبيرات الوقت. مثال: 3:00 مساءً، 15:00
- الكمية (الكمية): يتعرف على الكميات العددية ووحدات القياس. مثال: 10 كيلوجرامات، 2 لتر
- النسبة المئوية (PERCENT): يكتشف النسب المئوية. مثال: 50%، 0.5
- المال (المال): يستخرج القيم النقدية والعملات. مثال: 100 دولار، 50 يورو
- أخرى (متنوعة): فئة شاملة للكيانات التي لا تندرج ضمن الأنواع الأخرى. مثال: جائزة نوبل، آيفون 15 بوصة
أمثلة على التعرف على الكيانات المسماة
من الأمثلة الشائعة على تصنيف الكيانات المحدد مسبقًا ما يلي:

أبل: مُصنّفة كـ ORG (منظمة) ومُظلّلة باللون الأحمر. اليوم: مُصنّف كـ DATE ومُظلّل باللون الوردي. الثانية: مُصنّفة كـ QUANTITY ومُظلّلة باللون الأخضر. آيفون SE: مُصنّف كـ COMM (منتج تجاري) ومُظلّل باللون الأزرق. 4.7 بوصة: مُصنّفة كـ QUANTITY ومُظلّلة باللون الأخضر.
غموض في التعرف على الكيانات المسماة
الفئة التي ينتمي إليها المصطلح واضحة تمامًا للبشر. ومع ذلك ، ليس هذا هو الحال مع أجهزة الكمبيوتر - فهي تواجه مشاكل التصنيف. فمثلا:
فاز نادي مانشستر سيتي ( كمنظمة ) بلقب الدوري الإنجليزي الممتاز، بينما في الجملة التالية يُستخدم مصطلح "المنظمة" بمعنى مختلف. كان مانشستر سيتي ( كمكان ) مركزًا صناعيًا وصناعيًا رائدًا في مجال النسيج.
يحتاج نموذج NER الخاص بك إلى بيانات تدريب لإجراء استخراج دقيق للكيانات، ويصنف الكيانات المسماة بناءً على الأنماط المُكتسبة. إذا كنت تُدرّب نموذجك على اللغة الإنجليزية الشكسبيرية، فلن يتمكن من تحليل انستغرام. تُقيّم نماذج NER بمقارنة تنبؤاتها بالتعليقات التوضيحية الأساسية، وهي الكيانات الصحيحة المُسمّاة يدويًا في مجموعة البيانات.
كيف تعمل عملية التعرف على الكيانات المسماة؟
يكشف الخوض في عالم التعرف على الكيانات المسماة (NER) عن رحلة منهجية تتكون من عدة مراحل:
Tokenization
في البداية، يتم تقسيم البيانات النصية إلى وحدات أصغر، تسمى الرموز، والتي يمكن أن تتراوح من الكلمات إلى الجمل. على سبيل المثال، تم تقسيم عبارة "باراك أوباما كان رئيسًا للولايات المتحدة الأمريكية" إلى رموز مثل "باراك"، و"أوباما"، و"كان"، و"ال"، و"الرئيس"، و"من"، و"ال"، و" الولايات المتحدة الأمريكية".
كشف الكيان
وباستخدام مجموعة من المبادئ التوجيهية اللغوية والمنهجيات الإحصائية، يتم تسليط الضوء على الكيانات المسماة المحتملة. يعد التعرف على أنماط مثل الكتابة بالأحرف الكبيرة في الأسماء («باراك أوباما») أو التنسيقات المميزة (مثل التواريخ) أمرًا بالغ الأهمية في هذه المرحلة.
تصنيف الكيانات
بعد الكشف، يتم فرز الكيانات إلى فئات محددة مسبقًا مثل "الشخص" أو "المؤسسة" أو "الموقع". غالبًا ما تقود نماذج التعلم الآلي، التي يتم رعايتها على مجموعات البيانات المصنفة، هذا التصنيف. هنا، يتم وضع علامة "باراك أوباما" على أنها "شخص" و"الولايات المتحدة الأمريكية" على أنها "موقع".
التقييم السياقي
غالبًا ما يتم تضخيم براعة أنظمة NER من خلال تقييم السياق المحيط. على سبيل المثال، في عبارة "شهدت واشنطن حدثًا تاريخيًا"، يساعد السياق في تمييز "واشنطن" كموقع وليس اسم شخص.
تحسين ما بعد التقييم
بعد التحديد والتصنيف الأولي، قد يترتب على ذلك تحسين ما بعد التقييم لصقل النتائج. يمكن أن تعالج هذه المرحلة أوجه الغموض، أو دمج الكيانات متعددة الرموز، أو استخدام قواعد المعرفة لزيادة بيانات الكيان.
هذا النهج المحدد لا يزيل الغموض عن جوهر NER فحسب، بل يعمل أيضًا على تحسين المحتوى لمحركات البحث، مما يعزز رؤية العملية المعقدة التي يجسدها NER.
ما هي أهم مناهج التعرف على الكيانات المسماة؟
الهدف الأساسي لنموذج التعرف على الكيانات المسماة هو تصنيف الكيانات في المستندات النصية ووضع علامات عليها. تُستخدم الطرق الثلاث التالية عادةً لهذا الغرض، ولكن يمكنك أيضًا الجمع بين طريقة واحدة أو أكثر. فيما يلي الطرق المختلفة لإنشاء أنظمة التعرف على الكيانات المسماة:
الأنظمة المستندة إلى القاموس
ربما يكون النظام المعتمد على القاموس هو النهج الأكثر بساطة وأساسية NER. سيستخدم قاموسًا يحتوي على العديد من الكلمات والمرادفات ومجموعة المفردات. سيتحقق النظام مما إذا كان كيانًا معينًا موجودًا في النص متاحًا أيضًا في المفردات. باستخدام خوارزمية مطابقة السلسلة ، يتم إجراء تدقيق شامل للكيانات.
أحد عيوب استخدام هذا النهج هو أن هناك حاجة للترقية المستمرة لمجموعة بيانات المفردات من أجل الأداء الفعال لنموذج NER.
الأنظمة المستندة إلى القواعد
في هذا النهج ، يتم استخراج المعلومات بناءً على مجموعة من القواعد المحددة مسبقًا. هناك مجموعتان أساسيتان من القواعد المستخدمة ،
القواعد القائمة على الأنماط - كما يوحي الاسم، فإن القاعدة القائمة على الأنماط تتبع نمطًا صرفيًا أو سلسلة من الكلمات المستخدمة في المستند.
القواعد القائمة على السياق – تعتمد القواعد القائمة على السياق على معنى الكلمة أو سياقها في المستند.
الأنظمة القائمة على التعلم الآلي
في الأنظمة القائمة على التعلم الآلي، يُستخدم النمذجة الإحصائية لاكتشاف الكيانات. ويعتمد هذا النهج على تمثيل المستند النصي بناءً على خصائصه. ويمكن التغلب على العديد من عيوب النهجين السابقين، إذ يستطيع النموذج التعرف على أنواع الكيانات حتى مع وجود اختلافات طفيفة في تهجئتها.
تعلم عميق
تستفيد أساليب التعلم العميق لـ NER من قوة الشبكات العصبية مثل شبكات RNN والمحولات لفهم تبعيات النص طويلة المدى. الميزة الرئيسية لاستخدام هذه الأساليب هي أنها مناسبة تمامًا لمهام NER واسعة النطاق مع بيانات التدريب الوفيرة.
علاوة على ذلك، يمكنهم تعلم الأنماط والميزات المعقدة من البيانات نفسها، مما يلغي الحاجة إلى التدريب اليدوي. ولكن هناك صيد. تتطلب هذه الأساليب قدرًا كبيرًا من القوة الحسابية للتدريب والنشر.
الطرق الهجينة
تجمع هذه الأساليب بين أساليب مثل التعلم القائم على القواعد والإحصائي والتعلم الآلي لاستخراج الكيانات المسماة. الهدف هو الجمع بين نقاط القوة في كل طريقة مع تقليل نقاط الضعف فيها. أفضل جزء من استخدام الأساليب المختلطة هو المرونة التي تحصل عليها من خلال دمج تقنيات متعددة يمكنك من خلالها استخراج الكيانات من مصادر بيانات متنوعة.
ومع ذلك، هناك احتمال أن تصبح هذه الأساليب في نهاية المطاف أكثر تعقيدًا من أساليب النهج الواحد، لأنه عند دمج أساليب متعددة، قد يصبح سير العمل مربكًا.
أين يُستخدم التعرف على الكيانات المسماة؟ أهم حالات الاستخدام والقطاعات
كشف النقاب عن تنوع التعرف على الكيانات المسماة (NER).
يتم تطبيق NER في مختلف المجالات، من التمويل إلى الرعاية الصحية، مما يدل على قدرته على التكيف وفائدته الواسعة.
- برامج الدردشة: يساعد برامج المحادثة مثل GPT في فهم استفسارات المستخدم من خلال تحديد الكيانات الرئيسية.
- دعم العملاء: يقوم بتصنيف التعليقات حسب المنتج، مما يؤدي إلى تسريع وقت الاستجابة.
- الاستثمار والتمويل: يستخرج البيانات المهمة من التقارير المالية، لتحليل الاتجاهات وتقييم المخاطر.
- الرعاية الصحية: استخراج بيانات المريض من السجلات الصحية الإلكترونية (EHR).
- HR: يعمل على تبسيط عملية التوظيف من خلال تلخيص ملفات المتقدمين وتوجيه التعليقات.
- مقدمو الأخبار: يقوم بتصنيف المحتوى إلى معلومات ذات صلة، مما يؤدي إلى تسريع عملية إعداد التقارير.
- محركات التوصية: تستخدم شركات مثل Netflix NER لتخصيص التوصيات بناءً على سلوك المستخدم.
- محركات البحث: من خلال تصنيف محتوى الويب، يعمل NER على تحسين دقة نتائج البحث.
- تحليل المشاعر: هـيستخرج الإشارات إلى العلامة التجارية من المراجعات، مما يغذي أدوات تحليل المشاعر.
- التجارة الإلكترونية: تعزيز تجارب التسوق الشخصية.
- القانونية: تحليل العقود والوثائق القانونية.
يمكن دمج الكيانات المستخرجة من خلال NER في الرسوم البيانية المعرفية، مما يتيح تنظيم البيانات واسترجاعها بشكل أفضل.
من يستخدم التعرف على الكيانات المسماة (NER)؟
يُعدّ نظام التعرف على الكيانات المُسمّاة (NER) أحد أقوى تقنيات معالجة اللغة الطبيعية (NLP)، وقد شقّ طريقه إلى مختلف الصناعات والمجالات. غالبًا ما تستخدم المؤسسات نظامًا للتعرف على الكيانات المُسمّاة لأتمتة استخراج المعلومات وتحسين الكفاءة. إليك بعض الأمثلة:
- محركات البحث: يُعدّ نظام NER عنصرًا أساسيًا في محركات البحث الحديثة مثل جوجل وبينج. ويُستخدم لتحديد وتصنيف الكيانات من صفحات الويب واستعلامات البحث لتوفير نتائج بحث أكثر صلة. على سبيل المثال، بمساعدة نظام NER، يستطيع محرك البحث التمييز بين "Apple" الشركة و"Apple" الفاكهة بناءً على السياق. يُعدّ تطبيق نظام NER أمرًا بالغ الأهمية لتقديم نتائج دقيقة ومتوافقة مع السياق.
- برامج الدردشة: يمكن لروبوتات الدردشة ومساعدي الذكاء الاصطناعي استخدام نظام NER لفهم الكيانات الرئيسية من استفسارات المستخدمين. ومن خلال ذلك، يمكن لروبوتات الدردشة تقديم إجابات أكثر دقة. على سبيل المثال، إذا سألت "ابحث عن مطاعم إيطالية بالقرب من سنترال بارك"، فسيفهم روبوت الدردشة أن "إيطالي" هو نوع المطبخ، و"مطاعم" هو المكان، و"سنترال بارك" هو الموقع. تُمكّن عملية NER هذه الأنظمة من استخراج المعلومات ذات الصلة بكفاءة.
- الصحافة الاستقصائية: استخدم الاتحاد الدولي للصحفيين الاستقصائيين (ICIJ)، وهي منظمة إعلامية مشهورة، NER لتحليل أوراق بنما، وهي تسريب ضخم لـ 11.5 مليون وثيقة مالية وقانونية. في هذه الحالة، تم استخدام NER لتحديد الأشخاص والمنظمات والمواقع تلقائيًا عبر ملايين المستندات غير المنظمة، والكشف عن الشبكات المخفية للتهرب الضريبي في الخارج.
- المعلوماتية الحيوية: في مجال المعلوماتية الحيوية، تُستخدم تقنية NER لاستخراج بيانات أساسية، مثل الجينات والبروتينات والأدوية والأمراض، من أوراق البحث الطبية الحيوية وتقارير التجارب السريرية. تُسهم هذه البيانات في تسريع عملية اكتشاف الأدوية. يُمكن للتدريب المسبق للنماذج على مجموعات بيانات طبية حيوية كبيرة أن يُحسّن أداء أنظمة NER بشكل ملحوظ في هذا المجال التخصصي.
- مراقبة وسائل التواصل الاجتماعي: تستخدم العلامات التجارية على منصات التواصل الاجتماعي نظام NER لتتبع المقاييس العامة لحملاتها الإعلانية وأداء منافسيها. على سبيل المثال، تستخدم إحدى شركات الطيران نظام NER لتحليل التغريدات التي تذكر علامتها التجارية. ويكشف النظام التعليقات السلبية حول أمور مثل "الأمتعة المفقودة" في مطار معين، مما يُمكّنها من حل المشكلة في أسرع وقت ممكن. تُعد عملية NER أساسية لاستخلاص رؤى عملية من كميات هائلة من بيانات منصات التواصل الاجتماعي.
- الإعلان السياقي: تستخدم منصات الإعلانات نظام NER لاستخراج العناصر الرئيسية من صفحات الويب لعرض إعلانات أكثر صلة بالمحتوى، مما يُحسّن في نهاية المطاف استهداف الإعلانات ومعدلات النقر. على سبيل المثال، إذا اكتشف نظام NER كلمات مثل "هاواي" و"فنادق" و"شواطئ" في مدونة سفر، ستعرض منصة الإعلانات عروضًا لمنتجعات هاواي بدلاً من سلاسل الفنادق العامة.
- التوظيف وفحص السيرة الذاتية: يمكنك توجيه نظام NER للعثور على المهارات والمؤهلات المطلوبة بدقة بناءً على مهارات المتقدم وخبراته وخلفيته. على سبيل المثال، يمكن لوكالة التوظيف استخدام نظام NER لمطابقة المرشحين تلقائيًا. ويمكن للشركات استخدام نماذجها الخاصة المصممة خصيصًا لتلبية متطلبات محددة، أو الاستفادة من نماذج مُدربة مسبقًا لتحسين دقة نظام التعرف على الكيانات المُسماة لديها.
تطبيقات التعرف على الكيانات المسماة (NER) عبر الصناعات
لـ NER استخدامات متعددة في مجالات متعددة تتعلق بمعالجة اللغات الطبيعية وإنشاء مجموعات بيانات تدريبية لحلول التعلم الآلي والتعلم العميق. يُستخدم نموذج مُدرَّب لإجراء NER على بيانات جديدة، مما يُتيح استخراج الكيانات تلقائيًا من كميات كبيرة من النصوص. من بين تطبيقاته:
دعم العملاء
يمكن لنظام NER اكتشاف شكاوى العملاء واستفساراتهم وملاحظاتهم ذات الصلة بسهولة بناءً على المعلومات المهمة مثل أسماء المنتجات والمواصفات ومواقع الفروع والمزيد. يتم تصنيف الشكوى أو التعليقات بشكل مناسب وتحويلها إلى القسم الصحيح عن طريق تصفية الكلمات الرئيسية ذات الأولوية.
كفاءة الموارد البشرية
تساعد NER فرق الموارد البشرية على تحسين عملية التوظيف وتقليل الجداول الزمنية من خلال تلخيص السيرة الذاتية للمتقدمين بسرعة. يمكن لأدوات NER مسح السيرة الذاتية واستخراج المعلومات ذات الصلة - الاسم والعمر والعنوان والمؤهل والكلية وما إلى ذلك.
بالإضافة إلى ذلك ، يمكن لقسم الموارد البشرية أيضًا استخدام أدوات NER لتبسيط سير العمل الداخلي عن طريق تصفية شكاوى الموظفين وإحالتها إلى رؤساء الإدارات المعنية.
تصنيف المحتوى
يُعدّ تصنيف المحتوى مهمةً ضخمةً لمزودي الأخبار. فتصنيف المحتوى إلى فئات مختلفة يُسهّل اكتشافه، واستخلاص المعلومات منه، وتحديد الاتجاهات، وفهم المواضيع. ويمكن لأداة التعرّف على الكيانات المسماة أن تُفيد مزودي الأخبار، إذ يُمكنها مسح العديد من المقالات، وتحديد الكلمات المفتاحية ذات الأولوية، واستخراج المعلومات بناءً على الأشخاص، والمنظمات، والمواقع، وغير ذلك.
تحسين محركات البحث
NER يساعد في تبسيط وتحسين سرعة وملاءمة نتائج البحث. بدلاً من تشغيل استعلام البحث لآلاف المقالات ، يمكن لنموذج NER تشغيل الاستعلام مرة واحدة وحفظ النتائج. لذلك ، بناءً على العلامات الموجودة في استعلام البحث ، يمكن التقاط المقالات المرتبطة بالاستعلام بسرعة.توصية دقيقة بالمحتوى
تعتمد العديد من التطبيقات الحديثة على أدوات NER لتقديم تجربة محسنة ومخصصة للعملاء. على سبيل المثال، توفر Netflix توصيات مخصصة بناءً على سجل البحث والعرض الخاص بالمستخدم باستخدام التعرف على الكيانات المسماة.
تُحسّن تقنية التعرف على الكيانات المسماة كفاءة وموثوقية نماذج التعلم الآلي، لكنها لا تُحقق أفضل أداء إلا عند تدريبها على بيانات عالية الجودة ومُصنّفة بشكل متسق. وهنا تبرز أهمية الشريك الخبير: تُقدّم خدمات Shaip لتصنيف بيانات التعرف على الكيانات المسماة مجموعات بيانات شاملة وجاهزة للاستخدام في مجالات متنوعة كالتمويل والتأمين والرعاية الصحية، مما يُتيح لك تطوير نماذج تعلم آلي متقدمة وفعّالة بسرعة أكبر.
[اقرأ أيضًا: ما هي البرمجة اللغوية العصبية؟ كيف تعمل، فوائدها، تحدياتها، أمثلة عليها]
كيف يتم تقييم نموذج التعرف على الكيانات المسماة؟
يتم تقييم نماذج التعرف على الكيانات المسماة بثلاثة مقاييس: الدقة، والاستدعاء، ومقياس F1. وتقارن هذه المقاييس تنبؤات النموذج بمجموعة "حقيقية" من الكيانات المصنفة بشكل صحيح.
- دقةكم عدد الكيانات التي تنبأ بها النموذج والتي كانت صحيحة؟ يقيس هذا النموذج النتائج الإيجابية الخاطئة.
- تذكركم عدد الكيانات التي عثر عليها النموذج من بين الكيانات الموجودة فعلياً؟ فهو يقيس النتائج السلبية الخاطئة.
- درجة F1المتوسط التوافقي للدقة والاستدعاء - رقم واحد يوازن بينهما.
مثال عملي : في عبارة "تفتتح شركة آبل مكتبًا في سان فرانسيسكو في مارس 2026"، لنفترض أن النموذج صنّف "شركة آبل" و"سان فرانسيسكو" بشكل صحيح، وصنّف "مكتب" كموقع بشكل خاطئ، وأغفل "مارس 2026". ينتج عن ذلك نتيجتان إيجابيتان صحيحتان، ونتيجة إيجابية خاطئة واحدة، ونتيجة سلبية خاطئة واحدة. الدقة = 2/3 ≈ 0.67، والاستدعاء = 2/3 ≈ 0.67، ومقياس F1 ≈ 0.67. يُعدّ الاختبار على مجموعة بيانات تحقق منفصلة - بيانات لم يرها النموذج أبدًا أثناء التدريب - أمرًا ضروريًا للتأكد من قدرته على التعميم بدلًا من الحفظ.
مقارنة أدوات ومكتبات NER:
تسهل العديد من الأدوات والمكتبات القوية تنفيذ NER. فيما يلي مقارنة بين بعض الخيارات الشائعة:
| الأداة/المكتبة | الوصف | نقاط القوة | نقاط الضعف |
|---|---|---|---|
| سبا | مكتبة NLP سريعة وفعالة في Python. | أداء ممتاز، سهل الاستخدام، نماذج مدربة مسبقًا متاحة. | دعم محدود للغات أخرى غير الإنجليزية. |
| نلتك | مكتبة NLP شاملة في Python. | مجموعة واسعة من الوظائف، جيدة للأغراض التعليمية. | يمكن أن يكون أبطأ من spaCy. |
| ستانفورد كور إن إل بي | مجموعة أدوات معالجة اللغة الطبيعية (NLP) المستندة إلى Java. | دقيق للغاية، ويدعم لغات متعددة. | يتطلب المزيد من الموارد الحسابية. |
| OpenNLP | مجموعة أدوات تعتمد على التعلم الآلي لمعالجة اللغة الطبيعية. | يدعم لغات متعددة وقابلة للتخصيص. | قد يكون من المعقد إعداده. |
التدريب النموذجي في NER
يُعدّ تدريب النماذج جوهر بناء أنظمة فعّالة للتعرف على الكيانات المُسمّاة (NER). تتضمن هذه العملية تدريب نموذج على تحديد وتصنيف الكيانات المُسمّاة - مثل الأشخاص والمؤسسات والمواقع - من خلال التعلّم من بيانات التدريب المُصنّفة. يعتمد نجاح التعرف على الكيانات بشكل كبير على جودة بيانات التدريب هذه وتنوعها، بالإضافة إلى وضوح الفئات المُحدّدة مسبقًا لكل نوع من أنواع الكيانات.
أثناء تدريب النموذج، تُحلل خوارزميات التعلم الآلي البيانات النصية المُعلّقة بتسميات الكيانات الصحيحة. وقد أصبحت نماذج التعلم العميق، بما في ذلك الشبكات العصبية المتكررة (RNNs) والشبكات العصبية التلافيفية (CNNs)، شائعة الاستخدام بشكل خاص في مهام تحليل الترابطات العصبية. تتميز هذه الشبكات العصبية بقدرتها على التقاط الأنماط والعلاقات المعقدة داخل النص، مما يُمكّن نموذج تحليل الترابطات العصبية من التعرف على الكيانات بدقة مذهلة، حتى مع وجود اختلافات دقيقة في اللغة.
مع ذلك، يتطلب تدريب نماذج التعلم العميق للتعرف على الكيانات المسماة كميات هائلة من البيانات المُصنَّفة، مما قد يكون إنتاجه مستهلكًا للوقت ومكلفًا. لمعالجة هذا الأمر، تُستخدم غالبًا تقنيات مثل تعزيز البيانات والتعلم بالنقل. يُوسِّع تعزيز البيانات مجموعة بيانات التدريب من خلال توليد أمثلة جديدة من البيانات الموجودة، بينما يستفيد التعلم بالنقل من النماذج المُدرَّبة مسبقًا التي تعلمت أنماطًا لغوية عامة، مما يتطلب فقط ضبطًا دقيقًا للبيانات الخاصة بالمجال.
في نهاية المطاف، تعتمد فعالية نموذج NER على التدريب القوي للنموذج، والبيانات المصنفة عالية الجودة، والاختيار الدقيق لنماذج التعلم الآلي أو التعلم العميق المناسبة لمهمة التعرف على الكيان المحددة.
أفضل الممارسات لتحقيق معدل عائد صافي فعال
يتطلب تحقيق أداء عالٍ في التعرف على الكيانات المسماة (NER) اتباع مجموعة من أفضل الممارسات التي تُعنى بجودة البيانات وتطوير النماذج. فيما يلي بعض الاستراتيجيات الرئيسية للتعرف الفعال على الكيانات:
- إعطاء الأولوية لبيانات التدريب عالية الجودةأساس أي نموذج ناجح لـ NER هو بيانات تدريب متنوعة، مُشروحة جيدًا، وتمثيلية. يجب أن تغطي البيانات المُصنّفة نطاقًا واسعًا من أنواع الكيانات والسياقات لضمان إمكانية تعميم النموذج على سيناريوهات جديدة.
- معالجة النصوص الشاملة:تساعد الخطوات مثل تقسيم النصوص ووضع علامات على أجزاء الكلام النموذج على فهم بنية النص بشكل أفضل، مما يحسن قدرته على التعرف على الكيانات المسماة وتصنيفها بدقة.
- اختر الخوارزميات الصحيحة:في حين أن الطرق القائمة على القواعد يمكن أن تكون فعالة للمهام البسيطة أو المنظمة للغاية، فإن نماذج التعلم العميق مثل RNNs و CNNs غالبًا ما تقدم نتائج متفوقة لمهام NER المعقدة وواسعة النطاق.
- الاستفادة من النماذج المدربة مسبقًا:إن استخدام النماذج المدربة مسبقًا وضبطها بدقة على مجموعة البيانات المحددة لديك يمكن أن يقلل بشكل كبير من الحاجة إلى مجموعات البيانات الضخمة المصنفة، مما يؤدي إلى تسريع عملية التطوير وتحسين الأداء.
- التقييم المستمر للنموذج والضبط الدقيق:قم بتقييم أداء نموذج ner الخاص بك بانتظام باستخدام مقاييس تقييم قوية، وقم بتحديثه عندما تظهر بيانات جديدة أو مهام التعرف على الكيان.
- الوعي السياقي: انتبه دائمًا للسياق الذي تظهر فيه الكيانات. هذا يُساعد على توضيح أسماء الكيانات التي قد تحمل معانٍ متعددة، مما يُسهّل التعرّف عليها بدقة أكبر.
من خلال الالتزام بأفضل الممارسات هذه، يمكن للمؤسسات بناء أنظمة NER أكثر دقة وقابلية للتكيف وكفاءة وتتفوق في استخراج الكيانات من بيانات نصية معقدة.
دراسة حالة: التعرف على الكيانات المسماة في البحوث السريرية للأورام
تكمن صعوبة التعرف على الكيانات المسماة في النصوص السريرية، وهي النقطة التي تبرز فيها أهميتها القصوى. في أحد مشاريع الرعاية الصحية، قام شايب ببناء نظام للتعرف على الكيانات المسماة وإخفاء الهوية في النصوص السريرية لمساعدة مؤسسة رعاية صحية كبرى على تحويل سجلات الأورام غير المنظمة إلى مجموعة بيانات جاهزة للبحث، وذلك كله في إطار قانون HIPAA.
تجاوز العمل مجرد تحديد الأشخاص والمواقع. فقد قامت فرق متخصصة في علم الأورام بتصنيف مخطط كيانات غني عبر ما يقارب 10,000 صفحة من سجلات الأورام، بما في ذلك:
- الكيانات المرضية: مشكلة السرطان، علم الأنسجة، موقع الإصابة في الجسم، السلوك، الدرجة، مرحلة السرطان، وتصنيف TNM.
- كيانات العلاج: علاج السرطان، جرعة الدواء، التكرار، جراحة السرطان، وطريقة الإشعاع وجرعته.
- الكيانات الجينومية: الجين المدروس، رمز التباين، الطريقة، والعينة.
- حالة النفي: التمييز بين النتائج السلبية، والنتائج السلبية المحتملة، والنتائج غير المؤكدة، والنتائج الإيجابية المحتملة - أمر بالغ الأهمية في الملاحظات السريرية.
- العلاقات السريرية بين النيوكليوتيدات: ربط الكيانات مثل مشكلة السرطان → موقع الجسم وعلم الأنسجة → الدرجة، بحيث تلتقط البيانات المعنى، وليس مجرد التصنيفات.
تم جمع البيانات من مستودع Shaip الذي يضم أكثر من 5 ملايين سجل صحي إلكتروني، ثم تم إخفاء هوية البيانات باستخدام أسلوب "الملاذ الآمن" الخاص بقانون HIPAA - حيث تم استبدال كل معلومة صحية محمية ببيانات مرجعية تحمل علامات تعريفية، مما حافظ على فائدة البيانات مع الحفاظ على خصوصية المريض. وقد ساهمت جولات متتالية من ضمان الجودة وملاحظات العملاء في ضمان مطابقة البيانات لمعايير الجودة المطلوبة.
النتيجة: 10,000 سجل عالي الجودة، مجهول الهوية، ومُصنّف، تُشكّل الآن أساس تطوير نموذج معالجة اللغة الطبيعية (NLP) الخاص بالعميل في مجال الأورام. يُبيّن هذا المشروع متطلبات التعرف على الكيانات المسمّاة (NER) في بيئة الإنتاج السريري - من مُعلّقين مُختصّين في المجال، ومخطط مُدرك للعلاقات، ومعالجة النفي، والتزام تام بالمعايير - وهي متطلبات لا يُوفّرها أي نموذج عام جاهز للاستخدام. يُمكنكم الاطلاع على دراسة الحالة الكاملة لتطوير نموذج معالجة اللغة الطبيعية في مجال الأورام للاطلاع على التفاصيل الكاملة.
فوائد وتحديات NER؟
الفوائد :
- استخراج المعلومات: يحدد NER البيانات الأساسية، مما يساعد على استرجاع المعلومات.
- تنظيم المحتوى: يساعد على تصنيف المحتوى، وهو مفيد لقواعد البيانات ومحركات البحث.
- تجربة المستخدم المحسنة: يقوم NER بتحسين نتائج البحث وتخصيص التوصيات.
- تحليل الثاقبة: أنه يسهل تحليل المشاعر والكشف عن الاتجاه.
- سير العمل الآلي: NER يعزز الأتمتة، مما يوفر الوقت والموارد.
القيود/التحديات:
- حل الغموض:يواجه صعوبة في التمييز بين الكيانات المماثلة مثل "أمازون" كنهر أو شركة.
- التكيف الخاص بالمجال: كثيفة الاستخدام للموارد عبر مجالات متنوعة.
- اختلافات اللغة: تختلف الفعالية بسبب الاختلافات العامية والمناطقية.
- ندرة البيانات المسمى: يحتاج إلى مجموعات بيانات كبيرة مصنفة للتدريب.
- التعامل مع البيانات غير المهيكلة: يتطلب تقنيات متقدمة.
- مقياس الاداء: التقييم الدقيق أمر معقد.
- المعالجة في الوقت الحقيقي: الموازنة بين السرعة والدقة أمر صعب.
- تبعية السياق: تعتمد الدقة على فهم الفروق الدقيقة المحيطة بالنص.
- تباين البيانات: يتطلب مجموعات بيانات مُصنَّفة كبيرة، خاصةً للمجالات المتخصصة.
ما هو مستقبل التعرف على الكيانات المسماة؟
يتجه مستقبل التعرف على الكيانات المسماة نحو ما هو أبعد من مجرد الوسم، نحو أنظمة أكثر ثراءً وكفاءةً وتعددًا للغات. وتبرز عدة تحولات في هذا الصدد:
- عدد قليل من الطلقات وطلقات صفرية تعمل تقنيات التعلم على تقليل الاعتماد على مجموعات البيانات الضخمة المصنفة، مما يجعل توسيع نطاق التعرف على الكيانات المسماة إلى مجالات جديدة أسرع.
- ربط الكيان إن ربط الكيان المكتشف بسجل الرسم البياني المعرفي يحول التعرف على الكيانات المسماة من مجرد أداة تصنيف إلى خطوة استدلالية، بما في ذلك كطبقة أساسية للتوليد المعزز بالاسترجاع (RAG).
- التعرف على الكيانات المسماة باستخدام المحولات ونماذج التعلم الخطي استمر في رفع مستوى الدقة فيما يتعلق بالكيانات الغامضة والمتداخلة.
- التعرف على الكيانات المسماة متعدد اللغات وعبر اللغات يتوسع نطاق هذا الأمر مع عولمة الشركات وحاجتها إلى استخراج متسق عبر النصوص واللغات.
- نماذج مخصصة خاصة بالمجال أصبحت مجالات الطب والقانون والتمويل معيارية، حيث نادراً ما تظهر الكيانات المتخصصة في المدونات العامة.
لماذا تختار Shaip لمشروع التعرف على الكيانات المسماة (NER) الخاص بك؟
تتعثر معظم مشاريع التعرف على الكيانات المسماة ليس بسبب النموذج، بل بسبب البيانات. نوصي باستخدام Shaip في مشاريع التعرف على الكيانات المسماة لأننا نوفر العنصر الوحيد الذي لا تستطيع النماذج المدربة مسبقًا توفيره: بيانات تدريب دقيقة، ومخصصة للمجال، ومصنفة بشكل متسق وعلى نطاق واسع. نقدم لمبادرات التعرف على الكيانات المسماة واستخراج الكيانات ما يلي:
- مُعلِّقون متخصصون في المجال — بما في ذلك فرق متخصصة في المجالات الطبية والقانونية والمالية والسريرية المتعلقة بالتعرف على الأسماء، حيث تقصر الملصقات العامة.
- تصنيف العلاقات والنفي، وليس مجرد علامات كيانات مسطحة، حتى يتعلم النموذج الخاص بك المعنى والسياق.
- قانون HIPAA، وقانون حماية البيانات العامة (GDPR)، ومعيار SOC 2سير عمل متوافق مع البيانات الحساسة مثل المعلومات الصحية الشخصية والمعلومات الشخصية الحساسة، مع إخفاء الهوية.
- ضمان الجودة متعدد المراحل تم تصميمها بواسطة خبراء العمليات لضمان مطابقة كل مجموعة بيانات لمعيار الجودة الخاص بك.
- مقياس مرنبالاعتماد على قوة عاملة عالمية ومستودعات بيانات كبيرة خاصة.
سواء كنت بحاجة إلى مجموعة بيانات مخصصة للتعرف على الكيانات المسماة، أو إزالة التعريفات السريرية، أو شرح التعرف على الكيانات المسماة من البداية إلى النهاية ، فإن فرقنا يمكنها بناءها وفقًا لمخططك.
هل أنت مستعد لبناء بيانات تدريب موثوقة للتعرف على الكيانات المسماة؟ تواصل مع شايب لتحديد نطاق مشروعك والحصول على مجموعة بيانات مخصصة للتعرف على الكيانات المسماة لنماذج الذكاء الاصطناعي/التعلم الآلي الخاصة بك.
الأسئلة الشائعة حول NER: الأسئلة التي تطرحها الفرق قبل بدء المشروع
هذه هي الأسئلة التي تظهر في أغلب الأحيان عندما تنتقل الفرق من سؤال "ما هو التعرف على الكيانات المسماة؟" إلى تحديد نطاق مشروع التعرف على الكيانات المسماة، ووضع ميزانيته، وتوفير مصادره.
ما مقدار البيانات المصنفة التي أحتاجها لتدريب نموذج التعرف على الكيانات المسماة المخصص؟
ابدأ ببضعة آلاف من الأمثلة المصنفة لكل نوع من أنواع الكيانات كنقطة انطلاق عملية، إذ غالبًا ما تُدرَّب نماذج التعرف على الكيانات المسماة المخصصة في العالم الحقيقي على بضعة آلاف من العينات. يتطلب التدريب من الصفر عددًا أكبر بكثير، لذا تُفضِّل معظم الفرق ضبط نموذج مُدرَّب مسبقًا. تُعد جودة واتساق التصنيفات أهم من حجم البيانات الخام، فالبيانات المشوشة تُقلِّل الدقة بسرعة.
هل ينبغي عليّ بناء مجموعة بيانات التدريب الخاصة بتقنية التعرف على الكيانات المسماة داخلياً أم الاستعانة بمصادر خارجية لعملية الشرح؟
استعن بمصادر خارجية عندما تحتاج إلى حجم بيانات كبير، أو سرعة عالية، أو خبرة متخصصة، أو ضمان امتثال لا يمكنك توفيره داخليًا؛ ولا تُنشئ النظام داخليًا إلا إذا كان مخططك بسيطًا ومستقرًا وصغيرًا. تُقلل معظم الفرق من شأن عملية إضافة التعليقات التوضيحية - فالإرشادات، ووضع العلامات، وضمان الجودة تستهلك الجزء الأكبر من مشروع التعرف على الكيانات المسماة. شريك متخصص مثل Shaip يتولى هذا العبء، مما يسمح لمهندسيكم بالتركيز على النمذجة، وليس على وضع العلامات.
لماذا يستمر نموذج التعرف على الكيانات المسماة (NER) الخاص بي في فقدان الكيانات الخاصة بالمجال؟
نظرًا لأن النماذج العامة تُدرَّب على الأخبار ونصوص الإنترنت، فإنها نادرًا ما تتعرف على المصطلحات المتخصصة مثل أسماء الأدوية، أو البنود القانونية، أو الأدوات المالية. يكمن الحل في ضبطها بدقة على بيانات مُعَلَّمة ضمن المجال، تحتوي على هذه الكيانات في سياق واقعي. تُعدّ إرشادات التصنيف غير المتسقة سببًا شائعًا آخر، لذا احرص على تثبيت قواعد التصنيف قبل التوسع.
كم تبلغ تكلفة إنشاء مجموعة بيانات مخصصة للتعرف على الكيانات المسماة؟
تعتمد التكلفة على مدى تعقيد الكيان، وحجم التعليقات التوضيحية، والخبرة المطلوبة في المجال، ومتطلبات الامتثال. فتكلفة وضع العلامات السريرية أو القانونية أعلى من تكلفة النصوص العامة لأنها تتطلب معلقين متخصصين وضمان جودة أكثر صرامة. ويتم تحديد السعر عادةً لكل صفحة، أو لكل مستند، أو لكل وحدة مُعلّقة. تُحدد شركة Shaip نطاق كل مشروع من مشاريع التعرف على الكيانات المسماة وفقًا لمخططك ومعايير الجودة الخاصة بك، وتقدم عرض أسعار مُخصصًا.
أين يمكنني الحصول على بيانات تدريب عالية الجودة في مجال التعرف على الكيانات المسماة أو بيانات تدريب سريرية في هذا المجال؟
يمكنك الحصول على بيانات تدريب التعرف على الكيانات المسماة (NER) بثلاث طرق: ترخيص مجموعة بيانات جاهزة، أو جمع بيانات مخصصة وتصنيفها، أو توسيع مجموعة بيانات موجودة. بالنسبة للأعمال المتخصصة أو الخاضعة للوائح - كالمجالات الطبية والقانونية والمالية - يُعدّ مزود خدمات التصنيف المُدارة الخيار الأمثل. تُقدّم Shaip مجموعات بيانات NER مخصصة، وخدمات NER سريرية، وخدمات إخفاء الهوية المتوافقة مع قانون HIPAA، مصممة خصيصًا وفقًا لمواصفاتك الدقيقة.
ما الفرق بين استخراج الكيانات المسماة (NER) واستخراج الكيانات وربط الكيانات؟
يكشف التعرف على الكيانات المسماة ويصنفها حسب نوعها (شخص، مؤسسة، موقع). غالبًا ما يُستخدم مصطلح استخراج الكيانات كمرادف للتعرف على الكيانات المسماة، وأحيانًا بشكل أوسع لاستخراج الحقول المنظمة من النصوص. أما ربط الكيانات فيتجاوز ذلك، إذ يربط الكيان المُتعرف عليه بسجل فريد في قاعدة المعرفة، ما يُساعد على تحديد المقصود من كلمة "Apple" أو "Jordan".
خاتمة
إن التعرف على الكيانات المسماة (NER) هي تقنية معالجة اللغة الطبيعية القوية التي تحدد الكيانات الرئيسية داخل النص وتصنفها، مما يتيح للآلات فهم اللغة البشرية ومعالجتها بشكل أكثر فعالية. من تحسين محركات البحث والروبوتات إلى دعم دعم العملاء والتحليل المالي، فإن التعرف على الكيانات المسماة له تطبيقات متنوعة عبر مختلف الصناعات. وفي حين تظل التحديات قائمة في مجالات مثل حل الغموض والتعامل مع البيانات غير المنظمة، فإن التطورات الجارية، وخاصة في مجال التعلم العميق، تعد بتحسين قدرات التعرف على الكيانات المسماة وتوسيع تأثيرها في المستقبل.