شرح الدرس
يستكشف هذا الموضوع تخطيط أحد حلول الذكاء الاصطناعي، ويتناول كيفية التعرف على البيانات اللازمة لدعم الحل وكيفية جمعها وإعدادها.
ب { تخطيط حل الذكاء الاصطناعي وإعداده لتلبية احتياجات محددة
يستكشف هذا الموضوع تخطيط أحد حلول الذكاء الاصطناعي، ويتناول كيفية التعرف على البيانات اللازمة لدعم الحل وكيفية جمعها وإعدادها.
ب1 بيانات الذكاء الاصطناعي
- يتناول هذا الجزء المفاهيم الأساسية للبيانات واستخدامها في الذكاء الاصطناعي.
- يدرس المفاهيم الأساسية مثل الطريقة التي يتم بها تنظيم البيانات (أو عدم تنظيمها في الواقع)، وأنواع البيانات المختلفة.
- كما يبحث في مصادر البيانات المختلفة وكيفية استخدام الذكاء الاصطناعي.
- سيساعدك هذا على تحديد مصادر البيانات المناسبة لمشاريع الذكاء الاصطناعي ويوضح لك كيف يجب إعداد البيانات للاستخدام.
أنواع مختلفة من البيانات
قد توجد العديد من أنواع البيانات في أي سيناريو تريد التحقيق فيه لمشروع الذكاء الاصطناعي. تعد معرفة الأنواع المختلفة من البيانات وفهم خصائص كل فئة أمرا مهما، نظرا إلى تأثير نوع البيانات في طريقة التعامل معها والحفاظ عليها وفحصها. الأنواع الأربعة الرئيسة من البيانات التي تحتاج إلى مراعاتها هي:
- منظمة
- شبه منظمة
- غير منظمة
- السلاسل الزمنية
البيانات المنظمة
يتم تنظيم البيانات المنظمة بشكل جيد، حيث يتم تخزين عناصرها عادة بتنسيق جدولي (يشبه الجدول) (على سبيل المثال، عدد صحيح، ورقم عشري، وسلسلة، وما إلى ذلك)، ما يسهل البحث والمعالجة سهولة بالغة. عادة ما يتم تخزين هذا النوع من البيانات في جدول وقاعدة بيانات وملف CSV وسجل وما إلى ذلك. تصور قاعدة بيانات يستخدمها بائع تجزئة كبير لتخزين تفاصيل العميل (إما عبر الإنترنت وإما في المتجر وإما كليهما). تحتوي قاعدة البيانات هذه على بيانات منظمة. إنها كبيرة جدا ويتم تحديثها بشكل متكرر. نظرا إلى أن قاعدة البيانات تنظيما جيدا، يمكن الاستعلام عنها (يدويا أو برمجيا). ومع ذلك، نظرا لوجود العديد من نقاط البيانات التي يجب مراعاتها، فمن المستحيل تقريبا تحقيق تقرينا إدارتها بفعالية. علاوة على ذلك، من الصعب الحصول على أي معلومات تنبؤية أو رؤى منها ما يتعلق بتاريخ أنشطة الشراء من جانب العملاء. هذا هو المكان الذي يجب فيه استخدام التعلم الآلي والذكاء الاصطناعي. لأنه يوفر الأدوات الخوارزمية والإحصائية وموارد المعالجة المرتبطة بها (القابلة للتطوير إذا كانت في السحابة) للتعامل مع الحجم الهائل لقاعدة البيانات المنظمة. وسيمكن من العثور على الارتباطات الظاهرة والارتباطات المخفية داخل البيانات بسهولة وسرعة.
البيانات غير المنظمة
البيانات غير المنظمة ليست مهيكلة. من أمثلة هذا النوع من البيانات النص الخام والصور ومقاطع الفيديو والصوت والرسائل الفورية ومحتوى صفحة الويب. تعد منشورات وسائل التواصل الاجتماعي مثالا جيدا للبيانات غير المنظمة، حيث تحتوي عادة على مجموعة من بيانات النص والصورة والفيديو. تشمل الأمثلة الأخرى للبيانات غير المنظمة التي تجمعها المنظمة ملاحظات مكالمات العملاء، أو فيديوهات كاميرات المراقبة (CCTV)، أو منشورات منتديات الدعم - كل هذه البيانات متغيرة في طبيعتها. بحكم طبيعتها، يصعب للغاية معالجة البيانات غير المنظمة يدويا. إن افتقارها إلى هيكل محدد يجعل من الصعب البحث فيها دون استخدام أدوات متخصصة. بالإضافة إلى ذلك، في كثير من الحالات، يزداد الحجم الهائل لهذا النوع من البيانات بشكل كبير بمرور الوقت ويمكن أن يكون التخزين مكلفا للغاية. الأدوات القائمة على الذكاء الاصطناعي قادرة على معالجة هذا النوع من البيانات بدرجة جيدة من الدقة،
المهارات مهارات التواصل الشخصي: أخلاقيات العمل/الضمير:
- المبادرة
- المسؤولية
- الإنتاجية
مقدمة إلى الذكاء الاصطناعي (AI) الوحدة 21
اعتمادا على طريقة تدريبها. على سبيل المثال، يمكن لأدوات الذكاء الاصطناعي:
- تمييز الأشكال في الصور/الفيديو
- تحليل المشاعر على وسائل التواصل الاجتماعي ومشاركات المنتدى
- تنفيذ تقنيات معالجة اللغة الطبيعية (NLP).
عندما تعمل أنظمة الذكاء الاصطناعي بشكل جيد مع هذا النوع من البيانات، تكون النتائج مشجعة - يتم القبض على المجرمين عند نقاط الحدود، ويتم تعرف السيارات المسرعة بنجاح من خلال لوحات التسجيل الخاصة بها ويتم تعرف الأنسجة الخبيثة بشكل صحيح من خلال عمليات المسح. ومع ذلك، يمكن أن تختلف الدقة. على سبيل المثال، أصدرت بعض منظمات إنفاذ القانون إشعارات البحث عن أفراد أبرياء بسبب أنظمة غير دقيقة لتمييز الوجوه بالذكاء الاصطناعي.
البيانات شبه المنظمة
البيانات شبه المنظمة هي مزيج من البيانات المنظمة وغير المنظمة، وغالبا ما تنشأ لتحقيق التوازن بين الحاجة إلى سهولة القراءة البشرية والحاجة إلى المعالجة الآلية، إذ إن توافر بعض عناصر البيانات المنظمة يسهل تحليلها، وغالبا ما تتضمن البيانات شبه المنظمة استخدام البيانات الوصفية. يمكن اعتبار البريد الإلكتروني شبه منظم لأن التنسيق (العنوان والموضوع والنص والمرفقات وما إلى ذلك) موثق ومنفصل. ومع ذلك، فإن محتوى الجسم نفسه غالبا ما يكون غير منظم. يمكن أيضا رؤية البيانات شبه المنظمة في أمثلة JSON و XML، ما يوفر تبادلا فعالا للبيانات بين الخوادم والعملاء باستخدام الطلبات والاستجابات المستندة إلى واجهة برمجة التطبيقات (API).
المصطلح الرئيس البيانات الوصفية - البيانات التي تقدم وصفا لبيانات.
وقفة للتفكير هل تحتوي البيانات الوصفية (من النوع الذي تسجله الكاميرا الرقمية) على معلومات عن الصورة؟ تلميح ما نوع المعلومات التي تخزنها الكاميرا المستخدمة، وإعدادات الكاميرا، والمعلومات حول مكان وتاريخ التقاط الصورة مفيدة؟ توسيع الأفق توجد البيانات الوصفية في العديد من السياقات بما في ذلك رسائل البريد الإلكتروني وملفات الصوت والمواقع الإلكترونية. افحص بعض ملفاتك الخاصة وحدد البيانات الوصفية.
بحث
بيانات السلاسل الزمنية
بيانات السلاسل الزمنية هي ببساطة البيانات التي يتم جمعها في نقاط زمنية محددة (على سبيل المثال، كل يوم) أو تسجيلها على فترات زمنية متتالية (على سبيل المثال، كل 30 ثانية). يرتبط بشكل أساسي بالمراقبة والتتبع - على سبيل المثال، تسجيل درجات الحرارة، والإقبال على المتجر، والضغط، والرطوبة، والأمطار، وزوار الموقع. من ناحية البيانات، تستفيد بيانات السلاسل الزمنية من الطابع الزمني (الذي يحتوي على بيانات التاريخ والوقت) ما يجعل كل بند من بنود المدخلات فريدا. يمكن أن يكون معدل حقن هذا النوع من البيانات في بعض الأنظمة سريعا جدا (يحدث هذا الأمر عند التقاط البيانات بشكل متكرر). لهذا السبب، يجب استخدام قواعد بيانات فعالة يمكنها التعامل مع تكرار مدخلات البيانات.
وقفة للتفكير هل يمكنك التفكير في ثلاثة أمثلة على الأقل لبيانات السلاسل الزمنية؟ تلميح فكر في الصناعات والمواقف التي قد تولد بيانات السلاسل الزمنية. توسيع الأفق فكر في ما إذا كانت هذه البيانات تُجمع لفترات قصيرة أو طويلة.
لماذا قد تستخدم المؤسسات هذه الأنواع المختلفة من البيانات؟
قد تكون البيانات متاحة بتنسيق واحد فقط وبالتالي سيتعين على المؤسسة استخدامها في هذا النموذج. على سبيل المثال، قد تتلقى شركة إعلامية بيانات غير منظمة فقط من منشورات وسائل التواصل الاجتماعي. في كثير من الأحيان، يعكس نوع بيانات المصدر احتياجات المعالجة المعالجة جدا في تحليل البيانات غير المنظمة غير المنظمة إذا كانت المؤسسة بحاجة إلى الوصول السريع إلى السجلات المالية أو سجلات التوظيف، فستطلب تسجيل ذلك وتسليمه كبيانات منظمة. كما هو موضح، كما يتم البحث عن هذا النوع من البيانات بسرعة ويمكن إحضاره وإصداره بسهولة إلى تطبيقات أخرى. عندما يتم تحليلها باستخدام الذكاء الاصطناعي، يمكن أن تكون البيانات غير المنظمة أكثر فائدة بكثير من البيانات المنظمة. هذا لأن حلول الذكاء الاصطناعي المتقدمة جيدة جدا في تحليل البيانات غير المنظمة وإيجاد الاتجاهات والارتباطات والأنماط. ومن الأمثلة البسيطة على ذلك تخزين وتحليل الفحوصات الطبية للمرضى (وهي بيانات غير منظمة للذكاء الاصطناعي من الوصف المنظم للأشعة الذي تم إدخاله في قاعدة بيانات المرضى. قامت العديد من المؤسسات بتحليل التطبيقات الكبيرة (المتجانسة) (التي كانت توفر فيما سبق جميع احتياجات البيانات الخاصة بالمؤسسة) إلى عدد من الخدمات المصغرة المختلفة التي تتواصل مع بعضها البعض باستخدام بيانات غير منظمة. ونتيجة لذلك، سيكون لدى المؤسسات كمية هائلة من البيانات التي يتم تخزينها (واستهلاكها) بهذا التنسيق. تعد بيانات السلاسل الزمنية التي يتم الحصول عليها عليها كمجموعة متكررة من القياسات المسجلة بمرور الوقت أمرا بالغة الأهمية لتحليل الاتجاهات. هذا يجعلها لازمة للأشخاص والمنظمات العاملين في مجال التنبؤات. يشمل هؤلاء الأشخاص خبراء الأرصاد الجوية (التنبؤ بالطقس) أو سماسرة البورصة (التنبؤ بارتفاع أو انخفاض الأسهم) أو مهندسي البنية التحتية الذين يراقبون تدفق حركة المرور في المدينة.
المصادر الشائعة للبيانات
يتم إنشاء كميات هائلة من البيانات يوميا بناء على تفاعلات الأشخاص مع التكنولوجيا، ونتيجة لمعالجة مجموعة واسعة من المعاملات. يمكن تخزين هذه البيانات واستخراجها للتحليل للإجابة عن أسئلة الأعمال وبناء حلول الذكاء الاصطناعي.
الويب
- يمكن استخراج البيانات من المواقع الإلكترونية المتاحة للجمهور أو صفحات وسائل التواصل الاجتماعي أو لوحات الرسائل باستخدام تقنية تسمى (مسح الويب).
- هذه تقنية شائعة تستخدم في مجالات مثل أبحاث السوق ومراقبة الأسعار (والمقارنة) وتوليد العملاء المحتملين (تحديد العملاء المحتملين وجذبهم) وجمع البيانات لنماذج التعلم الآلي.
المهارات المهارات المعرفية: العمليات والاستراتيجيات المعرفية:
- حل المشكلات
المهارات المعرفية: الإبداع:
- الإبداع
وقفة للتفكير فكر في استخدامك الخاص للإنترنت. تلميح ما مقدار البيانات التي تعتقد أنك تولدها كل يوم؟ توسيع الأفق كم من هذه البيانات شخصية أو يمكن تعرفها بشكل شخصي؟
غالبا ما يستخدم مصطلح (تحليل "parse") لوصف عملية استخراج البيانات المنظمة (على سبيل المثال، الأسماء والأسعار وما إلى ذلك) من البيانات غير المنظمة أو شبه المنظمة (على سبيل المثال، لغة ترميز النص التشعبي لصفحة الويب (HTML)). الخطوات الأساسية لاستخراج البيانات من الويب موضحة في الشكل 21.5.
مقدمة إلى الذكاء الاصطناعي (AI) الوحدة 21

1 حدد الموقع المستهدف والبيانات التي تحتاج إليها منه 2 تحقق من بنية موقع إلكتروني لاكتشاف كيفية تنظيم البيانات 3 اكتب كود برنامج لجلب صفحات الويب عبر الطلبات 4 حل محتوى HTML الناتج لاستخراج البيانات المطلوبة 5 قم بتخزين البيانات بتنسيق منظم، مثل CSV أو JSON أو قاعدة بيانات 6 استخدام البيانات في المشاريع المتعلقة بالذكاء الاصطناعي
عند التفكير في استخراج البيانات من الويب، من المهم أن تكون حذرا. يمكن اعتبار هذا النشاط انتهاكا لشروط خدمة موقع إلكتروني. يجب عليك دائما التحقق من أن استخراج البيانات مسموح به. تمثل المنتديات ولوحات الرسائل مصدرا غنيا جدا للبيانات نظرا إلى تحديثها باستمرار بمحتوى مستخدم جديد. عادة ما يتضمن نوع البيانات التي يمكن استخراجها منها:
- المحتوى الذي ينشئه المستخدم (عناوين السلاسل والرسائل والمشاركات والردود وما إلى ذلك)
- ملفات تعريف المستخدمين
- البيانات الهيكلية المتعلقة باللوحات/المنتديات (على سبيل المثال، الفئات، وتنظيم الموضوعات، وما إلى ذلك)
- البيانات المستندة إلى الوقت، بما في ذلك تواريخ وأوقات الإنشاء، وتكرار المشاركات، وتكرار المشاركات، وما إلى ذلك.
- البيانات الوصفية، بما في ذلك علامات الموضوع، والتصويت لأعلى ولأسفل، والمشاهدات، وما إلى ذلك.
- الروابط المضمنة أو المراجع المستخدمة في المنشور.

مثال عملي
يوضح المثال العملي الآتي كود بايثون نموذجي يقوم بعملية استخراج بيانات بسيطة من موقع مصمم خصيصا للمتعلمين للسماح للمتعلمين بممارسة هذه العملية. استخدم محرك بحث للبحث عن 'Scrape this site tool'. يعرض الشكل 21.6 صفحة الويب المحددة من خلال عميل استعراض ويب.
مقدمة إلى الذكاء الاصطناعي (AI) الوحدة 21
الشكل 21.7 يظهر HTML الأساسي. هذا مجرد مقتطف لبلد واحد 'جنوب أفريقيا'.
``html <div class="col-md-4 country"> <h3 class="country-name"> <i class="flag-icon flag-icon-za"></i> South Africa </h3> <div class="country-info"> <strong>Capital:</strong> <span class="country-capital">Pretoria</span><br> <strong>Population:</strong> <span>49000000</span><br> <strong>Area (km<sup>2</sup>):</strong> <span class="country-area">1219912.0</span><br> </div> ``

يوضح الشكل 21.8 مثالا على كود بايثون يجمع البيانات من الموقع، حيث يستخرج البيانات الرئيسة ويخزنها.
```python import requests from bs4 import BeautifulSoup import json
URL of the website you want to scrape
url = 'https://www.scrapethissite.com/pages/simple/'
Send a GET request to the website
html_content = requests.get(url)
Parse the HTML content of the page with Beautiful Soup
soup = BeautifulSoup(html_content.text, 'html.parser')
Create an empty dictionary to store our scraped data...
countries_data = {}
Loop over each Country...
for countrydiv in soup.findall("div", class ="col-md-4 country"): countryname = countrydiv.find("h3", class ="country- name").gettext(strip=True) capital = countrydiv.find("span", class ="country- capital").gettext(strip=True) population = countrydiv.find("span", class ="country- population").gettext(strip=True) area = countrydiv.find("span", class ="country- area").gettext(strip=True)
Append discovered country into the dictionary
countriesdata[countryname] = { "Capital": capital, "Population": population, "Area": area }
Convert the dictionary to JSON and write it to a new file
with open(r'countriesdata.json', 'wt') as jsonfile: json.dump(countriesdata, jsonfile, indent=4) ```

مقدمة إلى الذكاء الاصطناعي (AI) الوحدة 21
يوضح الشكل 21.9 بعض البيانات المستخرجة بتنسيق JSON من الملف الذي تم إنشاؤه.
``json "Mayotte": { "Capital": "Mamoudzou", "Population": "159042", "Area": "374.0" }, "South Africa": { "Capital": "Pretoria", "Population": "49000000", "Area": "1219912.0" }, "Zambia": { "Capital": "Lusaka", "Population": "13460305", "Area": "752614.0" } ``

كما ترى، أصبحت هذه البيانات الآن نظيفة وخالية من أي محتوى متعلق بـ HTML، ما يجعلها مناسبة للإدخال في أي عملية تعلم آلي.
تجدر الإشارة هنا إلى أن بعض المواقع الإلكترونية لا تسمح بالطلبات البرمجية، وذلك لأن جزءا من هذا الطلب يتضمن "سلسلة وكيل المستخدم". تحدد هذه القيمة لخادم الويب الذي يقدم الخدمة اسم أداة البرنامج التي تقدم الطلب، فعلى سبيل المثال، يُعرف المتصفح على أنه، Google Chrome® أو Apple Safari® أو Microsoft Edge®، وما إلى ذلك. عادة ما تكون هذه الأمور مقبولة؛ إلا أنه عندما يقوم برنامج بإجراء طلب، فإنه عادة لا يخفي طبيعته (مثل "لغة بايثون")، ما قد يؤدي إلى رفض خادم الويب للطلب. من الممكن انتحال أو تزييف سلسلة وكيل المستخدم للتغلب على تردد خادم الويب، ما يجعل برنامجك يقلد عميل متصفح ويب أصلي. قد توفر المواقع الإلكترونية الأخرى واجهات برمجة التطبيقات العامة (API) التي تسمح بالاستعلام عن مصادر البيانات الأساسية لموقع إلكتروني واستخراجها. اعتمادا على طبيعة البيانات، قد تكون هذه الخدمة مجانية أو تتطلب استخدام مفتاح واجهة برمجة التطبيقات (API) قابل للشراء يمنح الوصول.
الشكل 21.10 سلسلة وكيل المستخدم لجهاز حاسوب يعمل بنظام Windows 10 باستخدام متصفح Microsoft Edge.
مقدمة إلى الذكاء الاصطناعي (AI) الوحدة 21
المصطلح الرئيس المصدر المفتوح - مشاريع البرمجيات التي تُتاح مجانا للجمهور، وعادة ما تسمح لأي شخص باستخدام الشفرة المصدرية للمشروع وتغييرها وتوزيعها.

يتمثل أحد الأمثلة ذلك في Postcodes.io (كما هو موضح في الشكل 21.11)، وهو مشروع نشأ باستخدام برنامج مفتوح المصدر بواسطة Ideal Postcodes. يقدم خدمة مجانية للمطورين للبحث عن البيانات المتعلقة بالرموز البريدية في المملكة المتحدة وتفسير الإحداثيات واستخراج البيانات. تتوفر مجموعات بيانات مماثلة لمناطق مختلفة، مثل postcode.eu لبلدان الاتحاد الأوروبي و getpostalcodes.com لمجموعات أخرى من البلدان. على سبيل المثال، يحتوي getpostalcodes.com على بيانات عن 12 منطقة بريدية في الأردن بما في ذلك عمان (العاصمة)، بالإضافة إلى مناطق مثل الزرقاء والطفيلة واربد وجرش. تعتبر البرامج مفتوحة المصدر، مثل تلك البرامج المستخدمة في Postcodes.io، ناجحة جدا. مفتاح نجاحها هو أنها تسمح بالجهود التعاونية (من مجتمع المبرمجين) لتحسين المشروع بمرور الوقت، وإصلاح الأخطاء وإضافة وظائف وميزات جديدة عند الطلب. يوفر Postcodes.io عددا من نقاط النهاية المختلفة التي يمكن استخدامها للتحقق من بياناته. على سبيل المثال، يمكن استخدامه للتحقق مما إذا كان الرمز البريدي موجودا بالفعل ومكان وجوده في العالم.

من الممكن أيضا الوصول إلى هذه البيانات عبر نقطة النهاية باستخدام طلب HTTP GET إما من خلال متصفح الويب (كما هو موضح في الشكل 21.13)، وإما باستخدام أداة سحب بيانات ويب مخصصة بلغة بايثون (كما هو موضح في الشكل 21.14).
مقدمة إلى الذكاء الاصطناعي (AI) الوحدة 21
```json 1 { 2 "status": 200, 3 "result": { 4 "postcode": "SW1A 0AA", 5 "quality": 1, 6 "eastings": 530268, 7 "northings": 179545, 8 "country": "England", 9 "nhsha": "London", 10 "longitude": -0.124663, 11 "latitude": 51.49984, 12 "europeanelectoralregion": "London", 13 "primarycaretrust": "Westminster", 14 "region": "London", 15 "lsoa": "Westminster 020C", 16 "msoa": "Westminster 020", 17 "incode": "0AA", 18 "outcode": "SW1A", 19 "parliamentaryconstituency": "Cities of London and Westminster", 20 "parliamentaryconstituency2024": "Cities of London and Westminster", 21 "admindistrict": "Westminster", 22 "parish": "Westminster, unparished area", 23 "admincounty": null, 24 "dateofintroduction": "199002", 25 "adminward": "St James's", 26 "ced": null, 27 "ccg": "NHS North West London", 28 "nuts": "Westminster", 29 "pfa": "Metropolitan Police", 30 "codes": { 31 "admindistrict": "E09000033", 32 "admincounty": "E99999999", 33 "adminward": "E05013806", 34 "parish": "E43000236", 35 "parliamentaryconstituency": "E14000639", 36 "parliamentaryconstituency2024": "E14001172", 37 "ccg": "E38000256", 38 "ccgid": "W2U3Z", 39 "ced": "E99999999", 40 "nuts": "TLI32", 41 "lsoa": "E01004733", 42 "msoa": "E02000979", 43 "lau2": "E09000033", 44 "pfa": "E23000001" 45 } 46 } 47 } import requests
The URL of the API endpoint for the Postcodes.io service
url = 'https://api.postcodes.io/postcodes/SW1A%200AA'
Send a GET request to the API endpoint
response = requests.get(url)
Specify a User-Agent string for Google Chrome
headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/103.0.0.0 Safari/537.36' }
Send a GET request to the API endpoint with the custom headers
response = requests.get(url, headers=headers)
Check if the request was successful (status 200=OK)
if response.status_code == 200:
Parse the response JSON and then print it
data = response.json() print(data) else:
Display error message
print(f'Failed to retrieve data: HTTP Status Code {response.status_code}') ```


لاحظ استخدام سلسلة وكيل المستخدم المخادع لتوضيح كيفية تنفيذ ذلك. لحسن الحظ، لا تواجه Postcodes.io مشكلة في الرد على الاستعلامات البرمجية، لذلك هذا الأمر ليس ضروريا جدا في هذه الحالة. الناتج من كود بايثون موضح في الشكل 21.15.
``python {'status': 200, 'result': {'postcode': 'SW1A 0AA', 'quality': 1, 'eastings': 530268, 'northings': 179545, 'country': 'England', 'nhs_ha': 'London', 'longitude': -0.124663, 'latitude': 51.49984, 'european_electoral_region': 'London', 'primary_care_trust': 'Westminster', 'region': 'London', 'lsoa': 'Westminster 020C', 'msoa': 'Westminster 020', 'incode': '0AA', 'outcode': 'SW1A', 'parliamentary_constituency': 'Cities of London and Westminster', 'parliamentary_constituency_2024': 'Cities of London and Westminster', 'admin_district': 'Westminster', 'parish': 'WestminsterLondon', 'nuts': 'Westminster', 'pfa': 'Metropolitan Police', 'codes': {'admin_district', 'unparished area', 'admin_county': None, 'date_of_introduction': '199002', 'admin_ward': 'St James's', 'ced': None, 'ccg': 'NHS North West London': 'E09000033', 'admin_county': 'E99999999', 'admin_ward': 'E05013806', 'parish': 'E43000236', 'parliamentary_constituency': 'E14000639', 'parliamentary_constituency_2024': 'E14001172', 'ccg': 'E38000256', 'ccg_id': 'W2U3Z', 'ced': 'E99999999', 'ced': 'E99999999', 'nuts': 'TLI32', 'lsoa': 'E01004733', 'msoa': 'E02000979', 'lau2': 'E09000033', 'pfa': 'E23000001'}}} ``

مقدمة إلى الذكاء الاصطناعي (AI) الوحدة 21
يجب أن تكون البيانات المستخرجة برمجيا بهذه الطريقة مطابقة للطلب اليدوي للمتصفح، ويجب أن تدرك أنه يشيع استخدام رموز حالة HTTP للإشارة إلى الطلبات السيئة/الرموز البريدية غير الموجودة، ويوضح الشكل 21.16 الإجراءات.


وسائل التواصل الاجتماعي
تحظى وسائل التواصل الاجتماعي بشعبية استثنائية لدى الحكومات والشركات والأفراد (من جميع الأعمار). أدى اعتمادها في نطاق واسع إلى زيادة مذهلة في البيانات المولدة. لا تقتصر بيانات وسائل التواصل الاجتماعي على البيانات الموجودة في الرسائل أو الصور التي تم تحميلها، بل تتضمن أيضا جميع البيانات الوصفية المرتبطة بها (التاريخ والوقت والموقع الجغرافي وإبداء الإعجاب وعدم الإعجاب والردود وما إلى ذلك). يمكن لبعض المؤسسات استخدام هذه البيانات بعدة طرق، بما يتضمن:
- في خوارزميات التوصية لترويج المحتوى للمستخدمين الآخرين
- لإنتاج إعلانات مستهدفة
- ليتم بيعها لأطراف ثالثة (اعتمادا على شروط وأحكام الاستخدام).
للحصول على فكرة عن حجم وسرعة البيانات التي تم إنشاؤها، افحص الشكل 21.17. هذا يظهر ما يمكن لمستخدمي خدمة مثل منصة X (المعروفة سابقا باسم تويتر) إنتاجه خلال مدة زمنية محددة. +200 مليار تغريدة هي كمية هائلة من البيانات الجديدة. يوضح هذا المستوى من إنشاء البيانات مدى انتشار منصة X العالمي والمشاركة المستمرة لمستخدميها من خلال تطبيقات الهواتف الذكية. نظرا لأن منصة X ليست سوى إحدى منصات التواصل الاجتماعي من بين العديد من المنصات الأخرى، يتضح أن وسائل التواصل الاجتماعي تخلق تدفقا مذهلا من المحتوى الجديد.
وقفة للتفكير هل تستخدم وسائل التواصل الاجتماعي؟ هل فكرت يوما في مدى ظهور منشوراتك؟ تلميح افحص إعدادات وسائل التواصل الاجتماعي الخاصة بك وقم بتعديلها إذا كنت تعتقد أنك تشارك الكثير من المعلومات مع أشخاص لا تعرفهم. توسيع الأفق هل ظهر أي من منشوراتك بشكل غير متوقع على الإنترنت؟
نقطة البيع
- يتم جمع كمية هائلة من البيانات من أنظمة نقاط البيع (PoS) في متاجر البيع بالتجزئة.
- يتضمن ذلك المعلومات الأساسية اللازمة لمعالجة مشتريات كل عميل بشكل صحيح.
- كما تعطي البيانات المجمعة أيضا معلومات عن أنظمة مراقبة المخزون التي يستخدمها تجار التجزئة.
- هذا يسمح لأنظمة التحكم بالحفاظ على مستويات المخزون ثابتة عن طريق طلب المخزون ليحل محل البنود التي تم بيعها للعملاء.
المصطلح الرئيس رموز حالة HTTP - رموز عالمية مكونة من ثلاثة أرقام يصدرها الخادم عندما يستجيب للطلب المقدم من العميل، ورمز الحالة الذي يبدأ بالرقم 2 يشير إلى النجاح.
- ~ 6000 تغريدة/ثانية كل ثانية
- 350+ 000 تغريدة/س كل دقيقة
- +500 مليون تغريدة/س كل يوم
- ~ +200 مليار تغريدة/س سنويا
مثال على معاملة نقاط البيع مع تقديم بطاقة الدفع عبر قارئ البطاقات.
مقدمة إلى الذكاء الاصطناعي (AI) الوحدة 21
لمعرفة كيفية تصنيف البيانات من نظام نقاط البيع، انظر إلى الجدول 21.4.
الجدول 21.4 البيانات المأخوذة من المعاملة، مقسمة إلى أربع فئات رئيسة
| بيانات حامل البطاقة | بيانات المعاملة |
|---|---|
| رقم البطاقة • اسم حامل البطاقة • تاريخ انتهاء الصلاحية | معرف فريد تم إنشاؤه بواسطة نظام نقاط البيع • التاريخ • الوقت • المبلغ • العملة • اسم بائع التجزئة • رمز فئة التجزئة (على سبيل المثال، نوع النشاط التجاري) |
| بيانات الأمان | التفويض |
| قيمة التحقق من البطاقة (CVV/CVC) • بيانات شريحة EMV (يوروباي وماستر كارد وفيزا) • بيانات الشريط المغناطيسي | رمز التفويض • رمز الاستجابة (على سبيل المثال، موافق عليه، مرفوض) |
لا يمكن الاحتفاظ بجميع هذه البيانات بعد معاملة بائع التجزئة. تخضع بعض بعض البيانات الحساسة (رقم البطاقة الكامل، رمز التحقق من البطاقة، وما إلى ذلك) لمعايير أمان صارمة (مثل معيار أمان بيانات صناعة بطاقات الدفع (PCI DSS))، والتي تهدف إلى تقليل الاحتيال والوصول غير المصرح به. بالإضافة إلى البيانات التي يتم جمعها من خلال معاملات نقاط البيع، يقوم تجار التجزئة (مثل محلات السوبر ماركت) أيضا بجمع البيانات من خلال بطاقات الولاء التي تُصدر للعملاء المنتظمين. تم تصميم هذه البطاقات لتزويد العميل بتجربة تسوق محسنة، بما في ذلك:
- خصومات نقدية
- الوصول إلى العروض الخاصة داخل المتجر
- عروض منتجات محسنة
- عروض تسويقية مصممة خصيصا (على سبيل المثال، قسائم الخصم التي تتناسب مع عادات الشراء لدى العميل).
يقدم العملاء معلومات شخصية عند إنشاء حسابات بطاقات الولاء الخاصة بهم، بما في ذلك العنوان والعمر ومعلومات الأسرة. يتيح تحديد هوية العميل ببطاقة الولاء إمكانية تتبع سلوكيات وعادات التسوق الخاصة بالعميل على المدى القصير والطويل. لمعرفة كيفية تصنيف البيانات من بطاقة الولاء، انظر إلى الجدول 21.5. منحت أنظمة نقاط البيع وبطاقات الولاء تجار التجزئة فرصة الوصول إلى بيانات أكثر كثيرا مما كان متاحا لهم في الماضي. يمكن تحليل هذه البيانات لفهم عادات شراء العملاء وتفضيلاتهم. ويتم تحليل هذا النوع من البيانات من خلال استخدام خوارزميات التعلم الآلي. يمكن استخدام البيانات للتنبؤ بمبيعات المنتجات في أوقات مختلفة وفي أماكن مختلفة. وهذا هو السبب في أن بعض المنتجات المتوافرة في أحد فروع السوبر ماركت قد لا تكون بالضرورة متاحة في فرع آخر - لأنه قد تبين أن عددا قليلا جدا من العملاء يشترون السلعة في ذلك المكان. يسمح استخدام معلومات بطاقة الولاء لتجار التجزئة بإنشاء تجارب تسوق مخصصة والتأكد من أن قسائم الخصم تتوافق بشكل وثيق مع احتياجات العملاء. بالإضافة إلى ذلك، يمكن لبائعي التجزئة استخدام هذه البيانات للترويج للمنتجات الجديدة باستخدام الإعلانات المستهدفة وقسائم الخصم. الهدف من هذا العمل هو تحقيق الأرباح وجذب عملاء جدد والحفاظ على ولاء العملاء الحاليين. بالطبع، يتم تنظيم جمع البيانات من خلال لوائح حماية البيانات العامة. كما تمت مناقشته، لدى العديد من البلدان قواعد مماثلة تتطلب من تجار التجزئة جمع البيانات الشخصية وتخزينها ومعالجتها بطرق تعطي الأولوية للخصوصية والأمان.
مقدمة إلى الذكاء الاصطناعي (AI) الوحدة 21
الجدول 21.5 البيانات النموذجية وتفضيلات العملاء المخزنة في فئات مختلفة لحسابات بطاقات الولاء
| تفاصيل العميل الشخصية | بيانات المعاملة |
|---|---|
| الاسم • قنوات الاتصال • العنوان • رقم الهاتف • البريد الإلكتروني • رسالة نصية قصيرة • تفضيلات الاتصال • تاريخ الميلاد • معلومات الأسرة (الحجم، الأعضاء، وما إلى ذلك) | تاريخ الشراء • تكرار التسوق • حجم السلة • عدد العناصر • التكلفة الإجمالية • طريقة الدفع • بطاقة (خصم أو ائتمان) • نقد • استرداد القسيمة |
| البيانات السلوكية وتفضيلات المستخدم | بيانات المكافآت |
| تاريخ استخدام القسيمة • التسوق عبر الإنترنت • الردود على الترقيات • البريد الإلكتروني • الموقع الإلكتروني • رسائل البريد • تفضيلات المنتج (على سبيل المثال، الولاء للعلامة التجارية) • تفضيل الخدمة • خدمة التوصيل إلى المنزل • انقر واستلم • التسوق داخل المتجر • ملاحظات العملاء | نقاط الولاء التي تم الحصول عليها عليها • نقاط الولاء التي تم استردادها |
أنظمة التجارة الإلكترونية
يقصد بها التجارة عبر الوسائل الإلكترونية، ويشير المصطلح إلى شراء وبيع المنتجات أو الخدمات عبر الإنترنت باستخدام الإنترنت. إنه يكمل النهج التقليدي للمتاجر الفعلية أو يحل محله.
وقفة للتفكير كم مرة تشتري منتجات أو خدمات عبر الإنترنت؟ ما مدى حرصك على خيارات الاتصال التي تختارها عند إعداد حساب جديد؟ تلميح فكر في أنواع التواصل التي توافق عليها. توسيع الأفق فكر في فحص بعض الحسابات التي تستخدمها لتقليل رسائل البريد الإلكتروني غير المرغوب فيها التي تتلقاها.
تقوم جميع أنظمة التجارة الإلكترونية بجمع ومعالجة بيانات المعاملات. في الواقع، يتم إنشاء كميات هائلة من البيانات في مراحل مختلفة من عملية التجارة الإلكترونية. الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)
وتُستخدم هذه البيانات بعدة طرق بما في ذلك ما يأتي:
- التخطيط الإستراتيجي - على سبيل المثال، تُستخدم بيانات المعاملات لاتخاذ قرارات بشأن المنتجات والخدمات الجديدة التي يجب تطويرها، أو لفحص أنماط المبيعات لتحديد المنتجات أو الخدمات التي تقترب من نهاية عمرها وتحتاج إلى سحبها.
- التخطيط التشغيلي - على سبيل المثال، يتم استخدام البيانات للعثور على طرق جديدة للسوق وقنوات اتصال جديدة وما إلى ذلك. يتم استخدامه أيضًا لتوسيع نطاق الأعمال التجارية (يسمح الإنترنت ببيع العديد من المنتجات والخدمات في جميع أنحاء العالم).
- التخطيط اليومي - على سبيل المثال، يتم استخدام البيانات لإدارة الأفراد والفرق، لنقل الموظفين بين الأقسام للتغطية في حالات المرض أو الغياب، لإدارة النقل والخدمات اللوجستية الآتية استجابة لظروف الطقس، أو للعثور على أسرع الطرق عندما تكون هناك مشكلات في حركة المرور على الطرق.
تدعم أنظمة التجارة الإلكترونية أربعة أنواع رئيسية من المعاملات التجارية.
B2C (المبيعات بين الشركات والمستهلكين)
- هذا هو الشكل الأكثر شيوعًا للتجارة الإلكترونية وتستخدمه متاجر البيع بالتجزئة وخدمات البث والاشتراك (مثل Amazon و Netflix و Apple وما إلى ذلك).
- يوفر هذا النوع من المبيعات عددًا من الفوائد. على سبيل المثال، لا تفتح العديد من متاجر البيع بالتجزئة 24 ساعة في اليوم.
- تتيح التجارة الإلكترونية للعملاء طلب التسليم عبر الإنترنت.
- وهذا يمنح الشركات رؤية على مدار الساعة طوال أيام الأسبوع، دون الحاجة بالضرورة إلى فتح المتاجر عندما يكون الطلب منخفضًا.
B2B (المبيعات بين الشركات)
- يُستخدم هذا النوع من التجارة الإلكترونية بين الشركات المصنعة وتجار الجملة والخدمات المالية والأمن والنقل والخدمات اللوجستية والخدمات القانونية وما إلى ذلك.
- على سبيل المثال، تستخدم العديد من منافذ البيع بالتجزئة للتغطية للتعامل مباشرة مع الشركات المصنعة وتجار الجملة.
- بعض تجار التجزئة يصرون على أن تستخدم المنظمات التجارية التي يتعاملون معها الأنظمة نفسها، لتسهيل نقل العروض والأسعار وتبسيط معالجة الطلبات.
C2C (المبيعات بين المستهلكين)
- يُستخدم هذا النوع من التجارة الإلكترونية لدى المستهلكين لتبادل السلع والخدمات أو بيعها - على سبيل المثال، من خلال Etsy و eBay و Craigslist. يستخدم العديد من الأشخاص التجارة الإلكترونية لخفض النفقات الزائدة التي يتكلفونها.
- أحد المجالات التي أصبح فيها هذا الأمر ممارسة شائعة هو سوق ملابس الأطفال والرضع، حيث يمكن استبدال المنتجات عالية الجودة ببساطة مقابل قيمة الشحن البريدي أو التوصيل.
- يرى الكثير من الناس أن هذا النوع من إعادة الاستخدام أخلاقي للغاية ومثال جيد للمسؤولية الشخصية والاجتماعية.
C2B (المبيعات بين المستهلكين والشركات)
هذا شكل أقل شيوعًا من التجارة الإلكترونية ويشمل الأفراد، مثل الفنانين والمصورين والمؤثرين، الذين يبيعون السلع أو الخدمات للشركات. منذ سنوات عديدة يكلف الفنانون والمصورون بمشاريع محددة، ولكن الأهمية المتزايدة لمؤثري الإنترنت ظاهرة حديثة. تتطلب جميع هذه المعاملات التجارية منصات تجارة إلكترونية قوية وآمنة تقدم خدمات مثل الإعلانات والوظائف مثل مرافق البحث وسلال التسوق وعمليات الدفع الآمنة. على الرغم من أنه يمكن تصميم أنظمة التجارة الإلكترونية خصيصًا للعملاء الأكبر حجمًا، إلا أن المؤسسات الأصغر عادةً ما تصمم الحلول المتاحة تجاريًا مثل Magento و Shopify.
موضوعات ذات صلة لمزيد من المعلومات حول استخدام قنوات البيانات والاتصالات في الأعمال، راجع الوحدة 1: أنظمة تكنولوجيا المعلومات.
أجهزة إنترنت الأشياء (IoT)
- إنترنت الأشياء (IoT) هو المصطلح المستخدم لوصف شبكة الأجهزة اليومية التي تجمع البيانات وترسلها عبر الإنترنت.
- أمثلة شائعة على أجهزة إنترنت الأشياء (الأشياء في إنترنت الأشياء) والبيانات التي تجمعها موضحة في الشكل 21.18. غالبًا ما تحتوي هذه الأجهزة على أجهزة استشعار لالتقاط البيانات.
- لديهم أيضًا برامج متخصصة لتوصيل وتبادل البيانات المجمعة مع أنظمة أخرى عبر اتصال بالإنترنت.
220 الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)
يمكن أن تختلف أجهزة إنترنت الأشياء اختلافًا كبيرًا في الحجم والتعقيد، من الآلات الصناعية إلى التكنولوجيا الشخصية القابلة للارتداء. لقد أصبحت أكثر شيوعًا وانتشارًا من أي وقت مضى وتسهم بشكل كبير في حجم البيانات التي تم إنشاؤها في القرن الحادي والعشرين. تجمع أجزاء الذكاء الاصطناعي/التعلم الآلي في إنترنت الأشياء البيانات بطريقة تسمح بتحليلها واستخدامها لتحسين الأداء وتعزيز الكفاءة. على الرغم من أن قدرة إنترنت الأشياء على تحسين جودة حياة مستخدميه، إلا أنه ستكون هناك دائمًا مخاوف بشأن الخصوصية واستخدام وأمان البيانات التي يتم جمعها ونقلها و(ربما) مشاركتها مع أطراف ثالثة. ومع ذلك، فإن جميع الأجهزة المترابطة التي تسهم في إنترنت الأشياء هي مصادر محتملة للبيانات. على سبيل المثال، إذا كان لديك نظام أمان ذكي، فإن كل تفاعل مع النظام سيؤدي عادةً إلى توليد المعلومات الآتية:
- ضبط جهاز تنبيه التاريخ والوقت
- إذا كان النظام يحتوي على عدة مستخدمين برموز فردية، فسيسجل من قام بتفعيل التنبيه
- إلغاء ضبط جهاز تنبيه التاريخ والوقت
- بيانات حول من قام بإلغاء ضبط التنبيه.
يمكن أن تحتوي بعض أنظمة الأمان على إعدادات للغرف المختلفة. على سبيل المثال، قد يتم ضبط النظام لحذف الغرف التي توجد بها حيوانات أليفة. في هذا السيناريو، عند ضبط المنبه، سيسجل النظام الغرف التي تم حذفها.
- مثال آخر هو مستخدم يرتدي ساعة ذكية تلتقط بيانات عن التمرين الذي تم إجراؤه على مدار اليوم.
- يمكن اختيار كل نوع مختلف من التمارين وتسجيل وقت التمرين، بالإضافة إلى السعرات الحرارية المحروقة.
- تسجل ساعات أبل الحديثة أيضًا معايير أخرى مثل ضربات القلب وتشبع الأكسجين في الدم واكتشاف مستويات الضوضاء. حتى أنهم يمتلكون خاصية الكشف عن السقوط.
- يتم تسجيل جميع هذه البيانات على الجهاز ويمكن تنزيلها على الهاتف المحمول أو الحاسب الخاص بالمستخدم.
وقفة للتفكير كم عدد الأجهزة المتصلة بالإنترنت التي تستخدمها كل يوم؟ قم بعمل قائمة بجميع الأجهزة التي يمكنك الوصول إليها. تلميح فكر في بعض الأشياء الأقل وضوحًا مثل الثلاجات وتحديثات الحافلات التي تبث بثًا مباشرًا أو أنظمة أمان المنزل. توسيع الأفق ماذا عن المقاييس الذكية أو المصابيح الذكية أو كاميرات المراقبة أو أنظمة مراقبة الأطفال أو الأقفال الذكية أو منظمات الحرارة أو تكييف الهواء؟
221 الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)

- أنظمة التدفئة الذكية
- درجات الحرارة
- مستويات الرطوبة
- تم تسجيل الحد الأدنى/الأقصى
- إعدادات المستخدم
- أنماط الإشغال
- أجهزة مراقبة صحية يمكن ارتداؤها
- نبض
- معدل ضربات القلب
- مستويات النشاط، على سبيل المثال، الخطوات المتخذة
- أنماط النوم
- بيانات موقع GPS
- السعرات الحرارية المحروقة
- السيارات الذكية
- بيانات موقع GPS
- السرعة (الحد الأدنى/الأقصى)
- أنماط التسارع
- استهلاك الوقود
- الصيانة/التحذيرات
- سلوك السائق (للتأمين وما إلى ذلك)
المساعدون الأذكياء
يعد المساعد المنزلي (أو الذكي) أحد الأمثلة الشائعة لجهاز إنترنت الأشياء. ومن الأمثلة المعروفة على ذلك ما يأتي:
- سيري من أبل
- أليكسا وإيكو من أمازون
- جوجل نيست.
توجد هذه الأجهزة عادةً في المنزل أو المكتب. ويمكن أن تساعد على أتمتة المهام اليومية ويتحكم فيها باستخدام أوامر صوتية بسيطة. تستخدم الأجهزة الذكاء الاصطناعي لتمييز الكلام المعتمد على السحابة لتحويل الأوامر الصوتية إلى نص. ثم يقوم الجهاز بتنفيذ الأمر - على سبيل المثال، عن طريق إرسال تعليمات إلى أجهزة إنترنت الأشياء الأخرى (مثل تشغيل/إطفاء الضوء)، أو عن طريق استعلام قاعدة بيانات للحصول على المعلومات، أو عن طريق إجراء عمليات بحث حية على الإنترنت. وعند الحاجة، يتم تحويل النتائج مرة أخرى من نص إلى كلام وإرسالها إلى المستخدم. بفضل سهولة إعداد المساعد المنزلي ودمجه بسلاسة في الحياة المنزلية، أصبح المساعد المنزلي شائعًا بسرعة، خاصة لمن يواجهون تحديات جسدية أو عقلية. على الرغم من أن معظم الأشخاص يظنون أن المساعدين الأذكياء يشاركون المعلومات مع المستخدم فقط، إلا أن هذه الأجهزة تسجل أيضًا نطاقًا من المعلومات لكل تفاعل، مثل: موقع المستخدم، ووقت التفاعل وتاريخه، والسؤال المطروح، والاستجابة المعطاة، ومقدار الوقت المستغرق للرد. يسأل المساعدين أيضًا عما إذا كانت الإجابة قد ردت على السؤال بشكل صحيح أم لا. يسمح استخدام هذه المعلومات للخدمة بتحسين استجاباتها للمستخدمين الآخرين - وهذا ما يسمى حلقة التغذية الراجعة.
أنظمة التدفئة الذكية
أنظمة التدفئة الذكية هي أجهزة إنترنت أشياء تزداد شعبيتها بشكل كبير. فهي مزودة بسلسلة من أجهزة استشعار درجة الحرارة والرطوبة التي تجمع البيانات في الوقت الفعلي. وتشمل مصادر البيانات التي قد توفرها هذه المستشعرات درجة الحرارة (درجات مئوية أو فهرنهايت) والرطوبة (كنسبة مئوية) والتواريخ والأوقات والمواقع وما إلى ذلك. تحتوي بعض هذه الأجهزة على أجهزة استشعار يمكنها اكتشاف أنماط الإشغال (عند استخدام الغرف أو عدم استخدامها). يمكن للأجهزة الأكثر الأكثر تقدمًا استخدام الذكاء الاصطناعي لتحليل البيانات التي يجمعونها من أجل:
- توقع الأوقات التي سيتم استخدام الغرف
- تحديد أفضل إعدادات درجة الحرارة والرطوبة
- تفعيل عناصر التحكم في الغرف قبل التسخين
- إيقاف تشغيل الأنظمة قبل 60 دقيقة من احتمال مغادرة الشاغلين للغرفة.
كل هذا يساعد على تقليل استخدام الوقود، ما يخفض التكاليف.
222 الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)
أجهزة مراقبة صحية يمكن ارتداؤها
يمكن استخدام أجهزة مراقبة الصحة القابلة للارتداء بطريقتين مختلفتين تمامًا.
- يمكن استخدامها من جانب الأفراد الذين يرغبون في مراقبة صحتهم وفوائد الأنشطة البدنية في إطار برامج ممارسة التمارين وفقدان الوزن.
- يمكن للأطباء المتخصصين استخدامها في علاج الحالات الصحية ودعمها - لا سيما عندما يمكن الوصول إلى البيانات عن بُعد.
يمكن لمكونات الذكاء الاصطناعي/التعلم الآلي لهذه الأجهزة استخدام البيانات التي تجمعها للتنبؤ بالأحداث الصحية المحتملة بناءً على البيانات في الوقت الفعلي، وإصدار التنبيهات بحسب الضرورة. أحد الأمثلة الراسخة على ذلك هو مراقبة وعلاج مرض السكري من النوع 1 والنوع 2. في مثل هذه الحالات، يرسل جهاز مراقبة الصحة القابل للارتداء البيانات إلى الجهاز المحمول للشخص، وينصحهم بالتصرف قبل حدوث نقص أو ارتفاع السكر في الدم.
وقفة للتفكير هل تستخدم أي تقنيات قابلة للارتداء؟ أو هل تعرف أي شخص يفعل ذلك؟ ماذا تفعل الأجهزة؟ تلميح فكر في الأجهزة المرتبطة بالرياضة أو الموقع أو حتى أجهزة الألعاب القابلة للارتداء. توسيع الأفق هل يمكنك التفكير في عشرة أمثلة؟ قم ببعض البحث للعثور على المزيد.
الذكاء الاصطناعي في السيارات
استخدام الذكاء الاصطناعي/التعلم الآلي في السيارات (والمركبات الأخرى) على مدى العشرين عامًا الماضية قد أسفر عن العديد من الفوائد.
- تسمح بيانات الموقع الجغرافي للشركات برؤية تقدم العناصر التي يتم تسليمها عن طريق السكك الحديدية والطرق والبحر والجو. غالبًا ما تتم مشاركة البيانات مع العميل، الذي يمكنه رؤية الوقت المقدر للوصول على تطبيق جهاز محمول. بالإضافة إلى ذلك، تستخدم المؤسسات البيانات لتخطيط عمليات التسليم المستقبلية، لا سيما عندما يكون الوقت عاملاً مؤثرًا.
- تمتلك العديد من العائلات تطبيقات محمول على أجهزتها تشارك موقعها مع أفراد العائلة الآخرين، وهو أمر مفيد خاص عند السفر. بالإضافة إلى كونها مفيدة، يجد العديد من المستخدمين هذه المعلومات مطمئنة.
- يمكن لتطبيقات السفر إعادة توجيه رحلة السيارة تلقائيًا إذا كان هناك حادث أو عائق أمامها. ويمكنهم بعد ذلك إعادة حساب (وقت الوصول إلى الوجهة) ومشاركة المعلومات مع الآخرين في مجموعة عائلة السائق. يتم الحصول على هذه البيانات عندما يقوم المستخدمون الذين يواجهون الحادث أو العائق (بالإبلاغ) عن المشكلة من خلال تطبيق السفر. استنادًا إلى موقع المستخدم عند إعداد التقرير، يمكن للتطبيق تقدير خطورة المشكلة، ثم يشاركها مع مستخدمي الطريق الآخرين من خلال التطبيق.
- يمكن لأنظمة الذكاء الاصطناعي/التعلم الآلي التقاط معلومات حول سرعة القيادة (الحد الأدنى/الأقصى)، وأنماط التسارع والفرملة لتحليل سلوك القيادة. يمكن استخدام هذه البيانات لتقديم أسعار تأمين مخفضة. يمكن للسائقين الذين يظهرون سلوكيات غير لائقة أن يروا زيادة تكاليف التأمين الخاصة بهم.
- تستخدم الشركات بيانات استخدام وقود المركبات للتنبؤ بالتكاليف المستقبلية. تُستخدم بيانات الاستخدام أيضًا لإصدار تنبيهات وتحذيرات الصيانة التي تسمح للشركات والأفراد بحجز الخدمة وإصلاح سيارتهم قبل أن تتعطل. وهذا يسمح للشركة بالحفاظ على المستوى المأمول لخدمة العملاء.
223 الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)
مناقشة فكر في مجموعة واسعة من أجهزة إنترنت الأشياء القابلة للارتداء التي أصبحت تندمج بشكل متزايد في حياتنا اليومية، مثل أجهزة تتبع اللياقة البدنية، والساعات الذكية، وأجهزة مراقبة الصحة. ناقش أنواع البيانات الشخصية التي تجمعها هذه الأجهزة عنك. فكر في هذه الأسئلة الرئيسة:
- في رأيك، ما تداعياتها على الخصوصية والأمان؟
- ما شعورك حيال التوازن بين الفوائد التي تقدمها هذه الأجهزة والبيانات الشخصية التي تجمعها؟
- كيف يمكن استخدام الذكاء الاصطناعي للحصول على رؤى من أجهزة إنترنت الأشياء المختارة حول عادات الشخص وسلوكياته؟
- شارك أفكارك وناقش أي تدابير تعتقد أنه يجب عليك اتخاذها لحماية خصوصيتك في أثناء استخدام هذه التقنيات.
مصادر بيانات الشركات
إن مجموعة مصادر البيانات التي تنشئها وتستخدمها الشركات واسعة ومتنوعة بطبيعتها. وتُستخدم هذه البيانات لدعم عملياتهم اليومية (للشراء والإنتاج والتسويق والبيع والموارد البشرية وما إلى ذلك) ومساعدتهم على اتخاذ قرارات إستراتيجية فعالة. قد تتضمن مصادر البيانات الداخلية الشائعة:
- السجلات المالية، بما في ذلك البيانات المحاسبية
- بيانات الموارد البشرية (الموظف)
- بيانات المبيعات والتسويق
- بيانات العملاء (عادةً من خلال نظام إدارة علاقات العملاء)
- البيانات التشغيلية
تنقسم البيانات التشغيلية للشركة إلى بيانات حول:
- المخزون: المخزون/المنتجات التي تصنعها الشركة وتبيعها
- سلسلة التوريد: النظام الذي يأخذ المواد ويحولها إلى منتجات ثم يسلم هذه المنتجات إلى المتاجر والعملاء
- الخدمات اللوجستية: إدارة عملية سلسلة التوريد
يمكن للشركات استخدام الذكاء الاصطناعي لتحليل البيانات بعدة طرق. على سبيل المثال، يمكن استخدام الذكاء الاصطناعي لتحليل بيانات المبيعات لتحديد الاتجاهات المستقبلية والتنبؤ بها. هذا شيء تقوم العديد من المؤسسات بالتحقيق فيه بالفعل. عادةً ما يتم تخزين مثل هذه البيانات في قواعد البيانات الإلكترونية وجداول البيانات. قد تظل بعض المؤسسات تخزن هذه البيانات في مقراتها الخاصة (في الموقع)، لكن العديد من الشركات الأخرى قد نقلوا بياناتهم إلى التخزين السحابي، الذي توفره شركات مثل أمازون أو جوجل أو مايكروسوفت. ويمكنهم أيضًا استخدام مراكز بيانات (العلامة البيضاء) (التي تنتجها إحدى الشركات، والتي تحمل علامة تجارية أخرى). أحيانًا قد يستخدمون حلولًا مجمعة، حيث يتم الاحتفاظ ببعض البيانات محليًا في الموقع والبعض الآخر في السحابة. الميزة الرئيسة لتخزين السحابة هي أن البيانات المخزنة تُنسخ احتياطيًا عبر عدد من الآلات الافتراضية، ما يعني تقليل فرصة فقدان البيانات. بالنسبة لمعظم الشركات، يتضمن اختيار تخزين البيانات النظر في المهارات التقنية الداخلية، وتكاليف التخزين، والتوافر، والتشريعات المحلية ذات الصلة، والمخاوف المتعلقة بالأمان.
224 الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)
تأثير حجم مجموعة البيانات على تخزينها واستخدامها
كما تمت مناقشته أعلاه، لتخزين البيانات، ستحتاج المؤسسات إما إلى الحصول على حلول محلية (داخلية) وإما استخدام مراكز بيانات ذات علامة بيضاء وإما الاستثمار في خدمات التخزين السحابي (وإما استخدام مزيج من هذه الحلول). يجب مراعاة المشكلات الآتية:
- كلما كان حجم مجموعة البيانات أكبر، زادت سعة التخزين المطلوبة.
- يجب أن تكون أنظمة التخزين آمنة.
- يجب أن تكون أنظمة التخزين قابلة للتطوير لاستيعاب مجموعات البيانات سريعة النمو التي تجمعها الشركات.
- يجب تحقيق قابلية التوسع دون تعطل أو أي تراجع في الأداء أو زمن الوصول.
يمكن أن تكون تكاليف تخزين البيانات لمجموعات البيانات الكبيرة مكلفة للغاية، خاصة في حالة الحاجة إلى إتاحة البيانات دائمًا (أي يمكن الوصول إليها عند الحاجة). يقدم العديد من موفري الخدمات السحابية معدلات تخزين أقل للبيانات التي يجب الوصول إليها بشكل تكراري. في مثل هذه الحلول، يتم وضع البيانات بشكل أساسي في حالة (التجميد العميق) ولا يمكن الوصول إليها عادةً على الفور. ستكون تكلفة كل بايت لهذا النوع من تخزين البيانات أقل تكلفة بشكل ملحوظ من تكلفة تخزين البيانات المتوفرة دائمًا. هذا لا يختلف عن وضع مدخراتك في حساب التوفير المصرفي الذي يقدم فائدة أعلى - العائد أكبر، ولكن قد لا يتم سحب الأموال في أي لحظة.
استخدام البيانات الضخمة في حلول الذكاء الاصطناعي
تؤدي البيانات الضخمة دورًا مهمًا في تطوير أنظمة الذكاء الاصطناعي وفعاليتها، فهي مكتبة من المعلومات سريعة النمو، وتُجمع هذه المعلومات من الإنترنت، ووسائل التواصل الاجتماعي، وأجهزة إنترنت الأشياء (IoT)، وأنظمة العالم الحقيقي، والهواتف المحمولة وما إلى ذلك، ما يعني ببساطة أنها الوقود الذي يشغل آلة الذكاء الاصطناعي. يُستخدم هذا الحجم الكبير من البيانات المصنفة وغير المصنفة لتدريب نماذج التعلم الآلي، ويتحقق ذلك عن طريق اختيار واستخراج الميزات ذات الصلة من كتلة البيانات الخام المتاحة. بالإضافة إلى ذلك، فإن الكميات الهائلة من البيانات المتاحة تمكن علماء البيانات من التحقق من صحة نماذجهم وتقييمها. ويضمن هذا الأمر قدرة نماذج الذكاء الاصطناعي على التعميم الجيد للبيانات التي لم تطلع عليها (حتى الآن)، بدلاً من التحيز المفرط تجاه البيانات المحدودة (أحيانًا) التي تم تدريبها عليها. أحد السمات الهامة للبيانات الضخمة هو السرعة التي يمكن بها استيعابها حديثًا في نظام الذكاء الاصطناعي. وهذا يساعد على تحديد المشكلات المحتملة (على سبيل المثال، الانحراف عن الأصل) ويضمن أن تظل التوقعات دقيقة في المواقف الواقعية المتغيرة بسرعة (على سبيل المثال، التغيرات في أسعار سوق الأسهم). لا يكمن التحدي المتمثل في التعامل مع تعقيد البيانات الضخمة في سياق الذكاء الاصطناعي في تخزينها وتنظيمها فحسب، بل أيضًا في فهمها وتفسيرها بشكل فعال.
المتقابلات الخمسة للبيانات الضخمة
المتقابلات الخمسة للبيانات الضخمة هي المعايير المستخدمة لوصف الخصائص (والتحديات) الرئيسة للبيانات الضخمة، وعادةً ما تكون العناصر الأربعة الأولى (الموضحة في الشكل 21.19) أساسية لتحقيق العنصر الخامس: قيمتها الإجمالية.

المهارات المهارات المعرفية: العمليات والإستراتيجيات المعرفية:
- حل المشكلات
- اتخاذ القرار
المهارات المهارات المعرفية: العمليات والإستراتيجيات المعرفية:
- التفكير الناقد
المهارات المعرفية: الإبداع:
- الابتكار
المصطلح الرئيس البيانات الضخمة - هي مكتبة من البيانات سريعة النمو، وتُجمع هذه البيانات من الإنترنت، ووسائل التواصل الاجتماعي، وأجهزة إنترنت الأشياء (IoT)، وأنظمة العالم الحقيقي، والهواتف المحمولة وما إلى ذلك.
225 الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)
5. القيمة
الشكل 21.19 الأبعاد الأربعة (أو الخمسة) للبيانات هي المعايير المستخدمة لتقييم مدى ملاءمة البيانات المكتسبة لغرض الذكاء الاصطناعي/التعلم الآلي.
الحجم
يشير إلى الكمية الهائلة من البيانات التي يتم إنشاؤها وتخزينها - يمكن أن يتراوح حجمها من تيرابايت إلى زيتابايت. بالنسبة للذكاء الاصطناعي، تعد الكميات الكبيرة من البيانات أمرًا بالغ الأهمية لأنها توفر مجموعة بيانات أكثر شمولاً لتدريب التعلم الآلي، ما يؤدي إلى دقة أفضل للتنبؤات وتحسين عملية صنع القرار.
التباين
يشير إلى الأنواع المختلفة من تنسيقات البيانات ومصادرها، بما في ذلك البيانات المنظمة وشبه المنظمة وغير المنظمة والمصادر مثل النصوص والصور ومقاطع الفيديو والسجلات. بالنسبة للذكاء الاصطناعي، غالبًا ما تعمل مجموعة متنوعة من البيانات المتاحة على تحسين عملية التعلم الآلي. ويرجع ذلك إلى أن زيادة تنوع البيانات تتيح الوصول إلى مجال أوسع من المعلومات، ما يتيح المقارنة بشكل أفضل وتحديد الاتجاهات والارتباطات، وربما لم يكن هذا الأمر ممكنًا باستخدام بيانات أكثر تجانسًا (أو "نفس" البيانات).
السرعة
يشير إلى السرعة التي يتم بها إنشاء البيانات وتناولها ومعالجتها. بالنسبة للذكاء الاصطناعي، تعني السرعة العالية أن البيانات تتدفق إلى الأنظمة آنيةً أو شبه آنية. البيانات عالية السرعة تجعل أنظمة الذكاء الاصطناعي أكثر استجابة للتغيرات الظروف الواقعية، وتجعل توقعاتها أكثر دقة.
المصداقية
هذا هو قياس لجودة ودقة وموثوقية البيانات التي تم تناولها. أنظمة الذكاء الاصطناعي جيدة بقدر جودة البيانات التي تُغذى بها. فجودة المخرجات هي انعكاس لجودة المدخلات. ستنتشر بيانات ذات جودة سيئة وتتضخم عن طريق نظام الذكاء الاصطناعي، ما يؤدي حتمًا إلى نتائج معيبة وغير دقيقة. لهذا السبب، فإن التأكد من أن البيانات من مصدر موثوق هو خطوة مهمة في أي مشروع ذكاء اصطناعي.
226 الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)
القيمة
تحدد تقلبات البيانات وصحتها وحجمها ما إذا كانت البيانات ذات مغزى وجديرة بالتحليل - وبعبارة أخرى ما إذا كانت ذات قيمة. القيمة معيار حاسم للشركات التي تستخدم أنظمة أو خدمات الذكاء الاصطناعي، لأن إنشاء أنظمة أو خدمات الذكاء الاصطناعي عادة ما يكون مكلفًا، لذلك يجب أن تكون البيانات المستخدمة عالية الجودة لإعطاء نتائج جيدة. تحتاج الشركات إلى أن يكون لديها فكرة عن العائد على الاستثمار الذي من المحتمل أن تجنيه من استثمارها. من وجهة النظر التجارية، قد يشمل ذلك نتائج مثل:
- تحسين الكفاءة والإنتاجية
- تحسين (وزيادة سرعة) صنع القرار
- تجربة محسنة للعملاء
- منتجات وخدمات جديدة ومبتكرة
- انخفاض المخاطر والتكلفة (تحسين الربحية)
- تحسين استخدام الموارد الحالية
- تحسين مرونة وقابلية العمليات للتوسع.
البيانات النوعية مقارنة بالبيانات الكمية
وقفة للتفكير هل تعرف الفرق بين البيانات النوعية والبيانات الكمية؟ اكتب خمسة أمثلة على البيانات الكمية وخمسة أمثلة على البيانات النوعية. تلميح فكر في أنواع الأسئلة التي طرحت عليك في أي استبيان. توسيع الأفق فكر في الأسئلة التي قدمت لها إجابات بسيطة والأسئلة التي كنت قادرًا على الرد عليها بمزيد من الكتابة.
تأتي البيانات عادةً في شكلين: نوعي أو كمي. خصائص كل نوع من البيانات موضحة في الجدول 21.6.
الجدول 21.6 مقارنة البيانات النوعية بالبيانات الكمية مع توضيح الفروق بين نوعي البيانات
| البيانات النوعية | البيانات الكمية |
|---|---|
| تصف الصفات أو الخصائص | رقمي، على سبيل المثال، الكميات، المبالغ، الدرجات، النطاقات، وما إلى ذلك. |
| غير رقمي | تم جمعها عبر مجموعات البيانات المنظمة والأسئلة المغلقة |
| تركز بقوة على 'لماذا؟' و'كيف؟' | تصنيفات على نمط ليكرت، مثل '3 من 4' |
| تم جمعها من خلال الملاحظات والمقابلات والأسئلة المفتوحة واستطلاعات العملاء، وما إلى ذلك. | سهل القياس والتحليل الإحصائي |
- ويمثل كلا النوعين قيمة كبيرة عند إجراء البحوث واتخاذ القرارات.
- غالبًا ما يكمل بعضهما بعضًا لتوفير فهم أكثر شمولاً لأي موضوع.
- على سبيل المثال، قد يكون السؤالان التاليان (اللذان يطرحان على أحد العملاء) كاشفان للأمور ومفيدان بالقدر نفسه.
السؤال 1 (النوعي): (ما الذي يعجبك أكثر في المنتج؟)
السؤال 2 (الكمي): قيم المنتج من أصل 5 نجوم: (1=ضعيف، 5=ممتاز). سيؤثر اختيار الأسئلة النوعية أو الكمية تأثيرًا كبيرًا في مشروع الذكاء الاصطناعي بسبب البيانات الناتجة عن استخدامها. إذا، ما نوع البيانات الأفضل لمشاريع الذكاء الاصطناعي؟ في الحقيقة، لكل نوع من البيانات نقاط القوة والضعف الخاصة به، لكن يمكن القول إن مشاريع الذكاء الاصطناعي الأكثر موثوقية تتضمن مزيجًا متزنًا من الاثنين.
227 الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)
البيانات الكمية
البيانات الكمية أكثر تنظيمًا من البيانات النوعية، وهي مثالية لمعظم خوارزميات التعلم الآلي (الانحدار والتصنيف وما إلى ذلك)، لأنها تستهلك المدخلات الرقمية بكل سلاسة. بالإضافة إلى ذلك، تعمل الأساليب الإحصائية التقليدية بشكل جيد، ومن السهل تتبع التغييرات في البيانات الكمية بمرور الوقت. على الجانب السلبي، قد يتم فقدان الكثير من الفروق الدقيقة من الفروق الدقيقة باستخدام نظام (تسجيل) بسيط. بالإضافة إلى ذلك، من الممكن أن تتضمن الأسئلة تحيزًا اعتمادًا على كيفية صياغتها، وهذا أمر قد يكون من الصعب اكتشافه إذا تم جمع البيانات الكمية فقط.
البيانات النوعية
عادةً ما توفر البيانات النوعية معلومات أكثر تفصيلاً، تحتوي على التعبير عن الإعجاب وعدم الإعجاب والمشاعر والتصورات والدوافع والأسباب الكامنة. وغالبًا ما توفر هذه المعلومات السياق الذي يشرح أي نتائج تم الحصول عليها من البيانات الكمية. على الجانب السلبي، البيانات النوعية غير منظمة وقائمة على النصوص في طبيعتها وستتطلب معالجة أكثر تعقيدًا قبل أن تتمكن خوارزميات التعلم الآلي من استخدامها. على سبيل المثال، قد تكون هناك حاجة إلى تقنيات معالجة اللغة الطبيعية لتحويل النص إلى تنسيق للمعالجة (على سبيل المثال، من خلال التصنيف والترقيم). هناك اعتبار آخر وهو أن البيانات النوعية يمكن أن تؤدي إلى مخرجات أكثر تعقيدًا. قد تكون هناك حاجة إلى معرفة أكثر تحديدًا بالمجال (أي فهم الموضوع المعني الذي يركز عليه مشروع الذكاء الاصطناعي) لتفسير هذه المخرجات بشكل صحيح واكتساب رؤى مناسبة.
تطبيق النظرية قم ببناء قاعة مغلقة لاستضافة الحفلات الموسيقية والمسرحيات وإقامة الفعاليات الخيرية. يتميز المكان بنهج حديث يستخدم أدوات الذكاء الاصطناعي لإدارة مناطق جلوس الزوار، وأنظمة الصوت، والردهات، ومنافذ الطعام، ومرافق الحمامات، والتنقل، وأنظمة التدفئة والتهوية، وبروتوكولات السلامة من الحرائق. طلب منك عمل استبيان عبر الإنترنت لجمع التعليقات من الزوار بعد حضورهم إلى المكان. بمجرد جمعها، ستُحلل البيانات المجمعة بحلول الذكاء الاصطناعي وستستخدم للأغراض الآتية:
- تحسين الخدمات والمرافق
- قياس رضا الزوار
- توفير المقارنة المعيارية معايير المجال والمنافسين
- تحسين علاقات الزوار ومستويات التفاعل
- السماح باتخاذ القرارات بناءً على البيانات
هذه المهمة هي مهمة تصميم لجعلك تفكر في نوع الأسئلة التي تحتاج إلى طرحها. هل سيتولد عن هذه الأسئلة بيانات كمية أم نوعية؟ أم هل يجب أن يكون هناك مزيج من النوعين؟ كيف ستؤثر اختياراتك في كيفية معالجة نظام الذكاء الاصطناعي للبيانات؟ قم بإنشاء نموذج استبيان وقم بتجريبه مع زملائك.
التحليلات الوصفية
هذه هي عملية تحليل البيانات التاريخية لفهم ما حدث سابقًا. يوفر رؤى حول الأنماط والاتجاهات التي يمكن استخدامها لتدريب نموذج التعلم الآلي بشكل صحيح. تطبيق واقعي لهذا سيكون منظمة تجزئة تقوم بفحص مبيعاتها خلال الـ 12 شهرًا الماضية، وبعد تحديد منتجها الأكثر شعبية، تستخدم التحليل الوصفي لتحديد كيف ولماذا ومتى أصبح شائعًا بين العملاء.
228 الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)
- سيتضمن ذلك قيام الذكاء الاصطناعي بفحص بيانات المبيعات القديمة، وتحديد الاتجاهات والأنماط، وتقديم الرؤية المناسبة.
- في العادة، لن يستكشف هذا التحليل الوصفي الآثار المستقبلية (على سبيل المثال، في هذه الحالة كيف ستتطور مبيعات المنتج الشهير خلال الـ 12 شهرًا القادمة).
التحليلات التشخيصية
هذه عملية تحاول فهم لماذا وقعت أحداث أو سلوكيات معينة. يمكن أن يساعد هذا في تحديد هذه العوامل السببية على تحسين تنبؤات الذكاء الاصطناعي والدقة الشاملة للنتائج. وسيكون التطبيق الواقعي لهذا هو مثال مؤسسة تجارية تدير أسطولًا من حافلات النقل العام. تريد الشركة التأكد من أن جميع مركباتها تعمل بكفاءة وأمان، كما أنها تريد تقليل الأعطال وطلبات الصيانة غير المتوقعة - وكلها تزيد التكاليف وتؤدي إلى عدم رضا العملاء. تقوم الشركة بتزويد كل حافلة بأجهزة استشعار الأشياء التي تراقب ضغط الإطارات ومستويات البطارية والكبح والسرعة وأداء المحرك وما إلى ذلك. وهذا يسمح لها بجمع البيانات في الوقت الفعلي واستخدام التحليل التشخيصي لتقييم حالة كل مركبة وعملياتها. هذا، بدوره، يسمح بتحديد الأنماط أو الحالات الشاذة التي قد تشير إلى تآكل غير مبرر، والتنبؤ بفشل مكون ميكانيكي أو كهربائي قبل أن يحدث فعليًا. يمكن بعد ذلك الإبلاغ عن هذه المعلومات إلى فريق الصيانة في المؤسسة. وهذا يسمح لهم بجدولة صيانة سريعة واستباقية نسبيًا. وهذا من شأنه أن يمنع حدوث الأعطال، ويزيد من مدة عمل الحافلات، ويبقى العملاء سعداء.
الاستخراج والتحويل والتحميل (ETL)
هذه معالجة هندسية للبيانات تتكون من ثلاث مراحل أساسية:
- استخراج البيانات من عدد من المصادر المختلفة (على سبيل المثال، الملفات وواجهات برمجة التطبيقات وقواعد البيانات وما إلى ذلك).
- تعيين البيانات الأصلية إلى مجموعة جديدة من البيانات، بتنسيق ثابت. قد يتطلب هذا الأمر أحد أشكال التحويل (على سبيل المثال، الأحرف الكبيرة إلى الأحرف الصغيرة إلى الأحرف الصغيرة بالإنجليزية، والتواريخ الأمريكية إلى التواريخ الأوروبية، وما إلى ذلك).
- تحميل مجموعة البيانات الجديدة إلى موقع قابل للمشاركة، عادةً على السحابة.
تطور أدوات البيانات المعتمدة على السحابة وتخزين السحابة الأقل تكلفة قد شجع مهندسي البيانات على عكس مراحل 'التحويل' و'التحميل'، الأمر الذي يخلق ما يسمى بالاستخراج والتحويل والتحميل (ELT). أصبح هذا بسرعة الخيار المفضل.
التحليلات التنبؤية
استخدام التقنيات الإحصائية ونماذج التعلم الآلي للتنبؤ بالأحداث المستقبلية بناءً على البيانات التاريخية. والمثال الجيد على استخدام هذه التقنية هو شركة تأمين تستخدم التحليلات التنبؤية لتحديد ملف المخاطر لعميل محتمل. وهو ما من شأنه أن يسمح للشركة بتحديد علاوة واقعية للعميل، وهي علاوة توازن بين المطالبات المحتملة والتكاليف التشغيلية وربما مقبولًا للخدمات التي تقدمها.
التحليلات الوصفية
هذه هي عملية اقتراح الإجراءات التي تجعل نتائج معينة أكثر احتمالًا أو تقلل فرصة حدوث بعض المخاطر على الإطلاق. التطبيق الواقعي لهذه العملية سيتم في عالم البيع بالتجزئة. يمتلك العديد من تجار التجزئة الكبار مراكز توزيع متعددة ومتاجر بيع بالتجزئة تنتشر في جميع أنحاء البلد. وهم بذلك يواجهون التحدي المتمثل في موازنة مستويات الأسهم عبر شبكات البيع. إنهم بحاجة إلى التأكد من أن متاجرهم تحتوي على الكميات المناسبة من السلع لتلبية طلبات العملاء المحليين. كما أنهم بحاجة إلى تجنب مخاطر المخزون الزائد غير الضرورية.
229 الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)
- يمكن للأنظمة التي تعتمد على الذكاء الاصطناعي معالجة مستويات البيانات التي تم جمعها من المواقع المختلفة.
- ويمكن لهذه الأنظمة بعد ذلك تحليل مستويات المخزون وأوقات الشحن وتوقعات طلب العملاء وعوامل أخرى.
- ويمكنها استخدام هذه المعلومات لمعرفة أنماط السلوك والتنبؤ بالمتطلبات المستقبلية للعناصر المختلفة في مواقع مختلفة.
- يمكن لشركة بيع بالتجزئة استخدام هذه الأفكار لبيان حجم التخزين الصحيح، وحركة وتخزين العناصر عبر شبكتها - ما يقلل الهدر، ويقلل فرص المبيعات المفقودة، ويزيد الأرباح.
تمثيل البيانات
هو عملية تقديم البيانات في شكل رسومي (مثل الرسوم البيانية والرسوم التوضيحية، وما إلى ذلك) التي تساعد على توصيل المعلومات الرقمية أو الفنوية الأكثر تعقيدًا بطريقة أكثر قابلية للفهم للفئة المستهدفة.
ب2 جمع البيانات وتجهيزها
- يركز هذا الموضوع على كيفية جمع البيانات وإعدادها. سيساعدك ذلك على فهم العملية المستخدمة لتحديد البيانات اللازمة من مصادر البيانات المناسبة.
- أحد أهم العوامل هو فهم أن البيانات قد لا تكون بتنسيق مناسب وقد لا تكون منظمة كما هو مطلوب.
- هذا يعني أن هناك حاجة إلى عمل إضافي لإعداد البيانات للاستخدام.
- بالإضافة إلى ذلك، يغطي الموضوع الاعتبارات الأخلاقية والتشريعية والأمنية التي يجب مراعاتها.
المهارات المهارات المعرفية: العمليات والإستراتيجيات المعرفية:
- حل المشكلات
- التفسير
مهارات التواصل الشخصي: أخلاقيات العمل/الضمير:
- الإنتاجية
موضوعات ذات صلة راجع أجزاء مفهوم التحيز والحد من تأثير التحيز في مجموعات البيانات. اسأل نفسك عن سبب أهمية معالجة قضايا التحيز لجودة النتائج.
مبادئ وعمليات جمع البيانات وإعدادها لضمان بيانات عالية الجودة تناسب حلول الذكاء الاصطناعي يوضح هذا الجزء أفضل الممارسات التي يجب اتباعها عند جمع البيانات وإعدادها. يجب أن نتذكر دائمًا أن أحد الأسباب الأساسية لفشل مشاريع الذكاء الاصطناعي هو سوء اختيار البيانات وجمعها. يوجد خمس نقاط رئيسة يجب تذكرها عند جمع البيانات وإعدادها لحل الذكاء الاصطناعي.
1 فهم المتطلبات بشكل كامل تأكد من أن البيانات التي تم جمعها ذات صلة وتفي بمتطلبات مشروع الذكاء الاصطناعي الذي يتم العمل عليه. حدد أنواع البيانات المطلوبة وتنسيقاتها ومعدل تكرار جمعها (كل ساعة، يوميًا، شهريًا، وما إلى ذلك).
2 التأكد من دقة البيانات ومن اتباع ضوابط النزاهة تحقق من سلامة البيانات - تأكد من أن مصدر بياناتك الفعلي قانوني وآمن. يعد عقد البيانات طريقة جيدة لضمان هذه المعلومات وتسجيلها. تحقق من جودة البيانات - تحقق من عدم الاتساق والبيانات المكررة والبيانات المفقودة والأخطاء.
3 الحد من التحيز غير المقصود من خلال ضمان تنوع البيانات تأكد من أن البيانات تحتوي على القدر والفئة المناسبة من التنوع (على سبيل المثال، الديموغرافي والجغرافي، وما إلى ذلك). التأكد من أن ارتباط البيانات بسياق/طبيعة المشكلة التي تتم معالجتها.
4 التأكد من تطهير البيانات بشكل صحيح تطهير القيم المفقودة، والقيم الشاذة، والبيانات العشوائية غير الضرورية في مجموعة البيانات (البيانات العشوائية هي في الأساس بيانات غير ذات صلة يمكن أن تؤدي إلى مواقف غير متوقعة). تحويل البيانات باستخدام تقنيات التخطيط بحيث تكون جاهزة للاستخدام في نموذج تعلم آلي، وما إلى ذلك.
موضوعات ذات صلة راجع الجزء الخاص بجمع البيانات وتجهيزها. فكر في ما يجب القيام به من أجل إعداد البيانات لاستخدامها في مشروع. لماذا يجب إعداد البيانات؟
230 الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)
5 اتباع الإرشادات الأخلاقية والاعتبارات القانونية في جميع الأوقات قم بإخفاء هوية معلومات التعريف الشخصية (PII) حيثما أمكن ذلك. واحترم قوانين حماية البيانات والخصوصية المحلية (على سبيل المثال، اللائحة العامة لحماية البيانات في أوروبا).
بحث تتخصص مؤسستك في تقديم حلول تكنولوجيا المعلومات المصممة خصيصًا للقطاع المالي. نظرًا للظروف الصعبة في هذا المجال، تواجه الشركة صعوبة في الاحتفاظ بالموظفين ذوي المستوى الفني المناسب. ويبدو أن إحدى المسائل الرئيسة هي أن عدد الطلبات الواردة لأي وظيفة شاغرة معلن عنها مرتفع للغاية بحيث يتعذر على فريق الموارد البشرية معالجتها بسرعة. تم تقديم اقتراح لبناء حل تنبؤي بالذكاء الاصطناعي. سيتم تدريب هذا الحل على محتويات النماذج الطلبات التي سبق تقديمها ونتائج المقابلات. سيتم استخدامه بعد ذلك لتوفير نظام فرز أولي لتضييق نطاق الطلبات، قبل أن يقوم فريق الموارد البشرية بمعالجتها. ابحث عن المشكلات التي يجب أن تضعها في اعتبارك عند محاولة ضمان جمع بيانات عالية الجودة والتحضير لهذا النوع من حلول الذكاء الاصطناعي.
اختيار البيانات ومصادر البيانات المناسبة
عادة ما يكون نظام الذكاء الاصطناعي جزءًا من سلسلة التوريد الكاملة، يستخدم البيانات ويوفر النتائج التي تساعد المستخدمين النهائيين على اتخاذ قرارات مستنيرة. ولكي يعمل نظام الذكاء الاصطناعي بفعالية، من الضروري اختيار نوعية البيانات ومصادر البيانات المناسبة، وهو ما ينطوي على عدد من الخطوات الرئيسة.
تحديد أهداف المشروع أو المهمة
يساعد فهم أهداف مشروع الذكاء الاصطناعي على تحديد نوع البيانات المطلوبة للإجابة عن السؤال (الأسئلة) المحدد. على سبيل المثال، فإن النموذج المطلوب لإجراء التنبؤات الجوية سيحتاج إلى بيانات الطقس السابقة ليتم تدريبه بنجاح. ومع ذلك، إذا كنت تريد من الذكاء الاصطناعي التنبؤ باحتمالية حدوث السرقات في منطقة معينة، فستحتاج إلى الوصول إلى سجلات حوادث الشرطة و/أو مطالبات التأمين على المنازل. ببساطة، تتطلب الأهداف المختلفة بيانات مختلفة.
مراجعة البيانات المتاحة
من الممكن أن يكون لديك بالفعل حق الوصول إلى البيانات التي تطلبها. إذا كان هذا هو الحال، فلا داعي للحصول عليها بشكل منفصل. على سبيل المثال، قد تقوم المؤسسة بشكل روتيني بجمع البيانات المتعلقة بالأعمال التي تحتاج إليها في إطار عملياتها اليومية، لذلك يجب أن تحظى هذه البيانات بتخزين آمن. قد لا تكون بالتنسيق الصحيح، لكنها تمثل نقطة انطلاق جيدة، ما يوفر للشركة الوقت والمال الثمينين.
تحديد مدى سلامة وملاءمة البيانات الحالية المتاحة
إذا لم تكن البيانات متاحة بسهولة داخل الشركة، فيجب الحصول عليها. لذا فإن السؤال التالي هو (من أين؟). من المحتمل ألا يكون أي مصدر بيانات موجود يفي بالمعايير الخاصة بك بسهولة. في الواقع، هذا ليس نادرًا. إذا كان هذا هو الحال، فقد يكون من الضروري إنشاء أنظمة للمراقبة أو التغذية اللازمة لجمع البيانات التي تحتاج إليها. على سبيل المثال، قد تقوم شركة بستنة ترغب في الحصول على بيانات لزيادة إنتاجها بتركيب مستشعرات إنترنت الأشياء لمراقبة ونقل درجة الحرارة والرطوبة كل ساعة لإنشاء سلسلة زمنية موثوقة من البيانات.
المهارات المهارات المعرفية: العمليات والإستراتيجيات المعرفية:
- اتخاذ القرار
موضوعات ذات صلة لمزيد من التفاصيل حول مصادر البيانات، راجع الجزء الخاص بتحديد مصادر البيانات المناسبة والموثوقة والوصول إليها في هذه الوحدة.
231 الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)
المصطلح الرئيس عدم الملاءمة - عندما يكون نموذج البيانات بسيطًا لأن البيانات غير كافية لتحديد العلاقات بين المتغيرات بدقة.
موضوعات ذات صلة لمزيد من التفاصيل حول مصادر البيانات، راجع الجزء الخاص بالمتقابلات الخمسة للبيانات الضخمة في هذه الوحدة.
مناقشة في عام 2017، قالت الإيكونوميست، (إن المورد الأكثر قيمة في العالم لم يعد النفط، بل البيانات). ناقش مع زملائك لماذا قد يكون هذا هو الحال.
بمجرد تحديد المصدر، يجب أن يكون الاعتبار الحاسم هو: هل تحتوي هذه البيانات على الميزات الضرورية لمعالجة هدف مشروع الذكاء الاصطناعي؟ بمعنى آخر، هل تجيب عن السؤال الأساسي للمشروع؟ من المهم ملاحظة أن هذا السؤال ينطبق بالتساوي على المصادر الداخلية والخارجية.
- هل من السهل الوصول إلى البيانات؟
- هل مصدر البيانات موثوق وصادق؟
- هل البيانات دقيقة بشكل عام؟
- هل تحتوي البيانات على تنوع مناسب (تنوع النطاق لتجنب التحيز)؟
- هل تحتوي البيانات على الحجم الكافي لكل من التدريب والاختيار (لتجنب عدم ملاءمة النموذج)؟
- هل البيانات حديثة (أي، هل تم تجميعها في فترة قريبة تجعلها صالحة)؟
- هل البيانات ذات نوعية جيدة؟
- هل هناك أي قيود قانونية أو فنية على استخدام البيانات؟
- هل هناك أي مشكلات أخلاقية في استخدام هذه البيانات (على سبيل المثال، هل هناك أي مشكلات في معلومات تحديد الهوية الشخصية أو تأثيرات مجتمعية محتملة؟)
- إذا كان المشروع يحتاج إلى تدفق مستمر من البيانات (على سبيل المثال، لإعادة التدريب)، فهل سيكون هذا متاحًا باستمرار؟
بشكل حاسم، قد تلاحظ أن العديد من هذه الأسئلة تشير مباشرة إلى المتقابلات الخمسة التي تمت مناقشتها بالفعل. هذا لأن الهدف من طرح هذه الأسئلة هو تحديد البيانات ذات القيمة الجيدة. من الجيد إجراء تحليل أولي للبيانات للإجابة عن هذه الأسئلة. وإذا كانت الإجابات عن هذه الأسئلة تثير أي شكوك حول مصدر البيانات الذي تفكر فيه، فقد ترغب في البحث عن مصدر آخر، إن أمكن.
تحديد أوجه القصور في البيانات الحالية في ما يتعلق بالأهداف
عادةً ما يكون إجراء اختبار تجريبي صغير لتقييم مدى جودة تدريب البيانات للخوارزمية التي اخترتها فكرة جيدة. سيسمح لك باختبار دقة النموذج. هذا مفيد دائمًا قبل الالتزام بشراء الترخيص لمصادر البيانات الخارجية، والتي قد تكون مكلفة للغاية. ستتمكن من إثبات/نفي ما إذا كانت البيانات المتاحة تساعد على الإجابة عن السؤال المحدد. بعد الحصول على تعليقات من أصحاب المصلحة الآخرين (علماء البيانات والخبراء الآخرين في المجال وما إلى ذلك) مفيدًا أيضًا في هذه المرحلة.
جمع البيانات وتجهيزها للمشروع
- يجب على مستخدمي البيانات الحرص على الحصول على البيانات التي ستكون مناسبة للمشروع، سواء من حيث الهيكل أو الشكل.
- قد يؤدي عدم القيام بذلك إلى عدد من الصعوبات المحتملة في مخرجات المشروع.
- في هذا الجزء ستتعرف بعض الطرق التي يمكن أن يحدث بها ذلك والتأثير الذي سيترتب عليها.
وقفة للتفكير هل سبق لك أن جمعت بيانات لمشروع ما؟ هل قدم شخص ما بيانات متاحة بسهولة على الإنترنت؟ أم كان عليك إنشاء استبيان؟ تلميح فكر في السياق الذي كنت بحاجة فيه إلى البيانات والأسباب التي دفعتك لاختيار مصدر بيانات معين. توسيع الأفق لماذا احتجت إلى استخدام هذا المصدر بالذات؟ ما الذي كان بإمكانك فعله أيضًا؟
232 الوحدة 21 | مقدمة إلى الذكاء الاصطناعي (AI)
المصطلح الرئيس تمام الملاءمة - الحالة التي تتناسب فيها البيانات مع نموذج إحصائي بدقة بحيث لا يمكن استخدامها في أمثلة أكثر عمومية، أي أن تركيزها ضيق أو محدد للغاية.
مفهوم التحيز
إحدى أكثر المشكلات شيوعًا التي تحدث عند إعداد مجموعات البيانات لاستخدامها في مشروع هي وجود تحيز في البيانات. يحدث التحيز عندما يتم تمثيل ميزات معينة من مجموعة البيانات بشكل متكرر و/أو يتم ترجيح استخدامها بشكل أكبر. يوجد في الواقع العديد من أشكال التحيز (على سبيل المثال، التحيز في الاختيار، التحيز في التمثيل، التحيز الثقافي، التحيز التاريخي، وما إلى ذلك) وبعضها يمكن أن يصعب تحديده للغاية. هذا الأمر يصعب أكثر صعوبة بسبب حقيقة أننا، بصفتنا بشرًا، لدينا أصلًا مجموعة من التحيزات اللاواعية التي يمكن أن تؤثر في قدرتنا على اتخاذ القرارات. يمكن أن تؤدي التحيزات غير المحددة (أو غير المكتشفة) إلى:
أخطاء في التحليل الناتج: يمكن أن يكون أن يكون جمع البيانات متحيزًا عن غير قصد تجاه مجموعة معينة، ما قد يتسبب في حدوث أخطاء في التحليل الناتج. تعمل خوارزميات التعلم الآلي بشكل أفضل عندما تكون عامة، قادرة على التكيف مع البيانات الجديدة بسهولة.
مستويات دقة غالبا ما تتأثر: غالبًا ما تتأثر مستويات الدقة عندما لا تمثل البيانات المحددة جميع الجوانب ذات الصلة، وتشير مستويات الدقة المنخفضة بشدة إلى أن النموذج لا يعمل على النحو الأمثل (ما يعني تمام ملاءمة النموذج للبيانات المتحيزة).
نتائج منحرفة ومشوهة: عند اختراق مستويات الدقة، يُحتمل جدًا إنتاج نتائج منحرفة عند معالجة البيانات المعيبة وتحليلها. هذا يمكن أن يسبب مشكلات بسهولة في العالم الحقيقي. يرد في ما يأتي بعض المخاوف المحتملة:
- توصيات متحيزة في توظيف موظفين جدد
- توصيات متحيزة عند الموافقة على القروض والرهون العقارية وما إلى ذلك.
- توصيات متحيزة عند مراجعة عروض التأمين الصحي
- توصيات متحيزة عند تحديد المجرمين المحتملين في لقطات كاميرات المراقبة.
في حين أنه من غير الصحيح القول بأن (كل التحيز سيء)، فمن المحتمل أن يكون من العدل القول إن (التحيز غير المحدد - خاصة في بيانات التدريب - من المحتمل أن يمثل مشكلة كبيرة). كما ذكرنا أعلاه، هناك العديد من أنواع التحيز المختلفة.
هذه معاينة من الدرس. أكمل القراءة في التطبيق