سمحت جامعة أكسفورد لشركة OpenAI، الشركة التي تقف وراء ChatGPT، بتدريب نماذج الذكاء الاصطناعي لديها على نصوص تاريخية رُقمنت من مكتبة بودليان، حسبما أفادت The Guardian في 26 سبتمبر 2026. وتقول وثائق داخلية اطّلعت عليها الصحيفة إن مواد بودليان الممسوحة استُخدمت «لتغذية مجموعة تدريب OpenAI».
قبل أي شيء آخر، الجزء المهم لخصوصيتك: هذه القصة تتعلق بكتب وأطروحات قديمة انتهت حقوق نشرها، لا ببيانات شخصية لأي أحد. لم تكن رسائل أو صور أو ملفات أي شخص معنية. ومع ذلك تستحق القراءة المتأنية، لأنها تُظهر أين تقف صناعة الذكاء الاصطناعي الآن: تعاني نقصًا في المواد الجديدة المكتوبة بأيدي البشر، وتبحث عنها في كل مكان.
ما الذي حدث
أعلنت أكسفورد شراكة مع OpenAI في مارس 2025. وكان الهدف المعلن استخدام برمجيات OpenAI لرقمنة نصوص من بودليان، إحدى أشهر المكتبات في العالم، كي يصل إليها الطلاب والباحثون بسهولة أكبر. ووفقًا لـ The Guardian، لم يذكر ذلك الإعلان أن المواد ستُستخدم أيضًا لتدريب نماذج OpenAI.
ترفض أكسفورد فكرة أن شيئًا ما أُخفي. وقال متحدث باسم الجامعة للصحيفة إن الرقمنة كانت اهتمامها الأساسي، وإن الموظفين كانوا صريحين في أن المشروع سيسهم أيضًا ببيانات تدريب.
تسرد The Guardian ما مُسح أو نوقش حتى الآن:
- بحلول يونيو 2025، شورك مع OpenAI ما مجموعه 125,000 صورة ممسوحة من أطروحات تاريخية، منها أطروحات دكتوراه من جامعات أوروبية وأمريكية كُتبت في القرنين التاسع عشر والعشرين.
- مجموعة نادرة من 10,000 «أغنية شعبية مطبوعة» (broadside ballads) من القرن السادس عشر: كلمات أغانٍ ونوتات موسيقية كانت تُتداول في زوايا شوارع العصر التيودوري.
- ناقش الموظفون أيضًا رقمنة أوراق الدولة الأيرلندية من القرن الثامن عشر، والرسائل الخاصة للروائية الأيرلندية Maria Edgeworth، ودفاتر البنسلين الخاصة بـ Dorothy Hodgkin.
- يطرح العقد احتمال رقمنة شاملة لمجموعة بودليان كلها البالغة 23 مليون مادة، وناقشت محاضر الاجتماعات روبوت دردشة باسم «Ask the Bod».
تسجّل محاضر اجتماعات حُصل عليها بموجب طلب لحرية المعلومات مخاوف لدى موظفين في الجامعة، منهم أعضاء في لجنة حوكمة بودليان، بشأن المخاطر على السمعة من الشراكة مع OpenAI، وبشأن ما تعنيه صفقة مبنية على تقنية كثيفة الاستهلاك للطاقة لالتزامات الجامعة البيئية.
ما تقوله أكسفورد وOpenAI
المواد التي رُقمنت عبر المشروع مع OpenAI محدودة الحجم، وخارج نطاق حقوق النشر، واستخدام OpenAI لها ليس حصريًا.
متحدث باسم جامعة أكسفورد، عبر The Guardian
تقول الجامعة إن بودليان تحتفظ بحقوق المسوحات وستبدأ نشرها علنًا على الإنترنت خلال أشهر، كما تفعل مع شراكات رقمنة أخرى. وعلى خلاف بعض مشاريع مسح الكتب في أماكن أخرى، تبقى المجموعات نفسها سليمة.
وقال متحدث باسم OpenAI للصحيفة إن الشركة «فخورة» بضمان أن «نماذج الذكاء الاصطناعي اليوم تحفظ المعرفة التاريخية للعالم من أجل المستقبل». وأكسفورد هي العضو البريطاني الوحيد في مشروع NextGenAI التابع لـ OpenAI، الذي يضم أيضًا مكتبة بوسطن العامة وCaltech وMIT وجامعة ميشيغان.
القصة الأكبر: الذكاء الاصطناعي ينفد منه ما هو جديد من الكتابة البشرية
تضع The Guardian الصفقة في سياقها. فالنصوص المجموعة من الويب المفتوح باتت مشبعة أكثر فأكثر بمواد مولّدة بالذكاء الاصطناعي، ما يجعلها أقل فائدة لتدريب نماذج جديدة، لذا لجأ المطوّرون إلى مجموعات كتب مادية، تاريخية في الغالب، لم تكن على الإنترنت أصلًا.
- يتحدث باعة الكتب المستعملة عن موجة طلبات لعناوين مغمورة، مثل دليل للأدوات الزراعية في أفريقيا في القرن الثامن عشر أو سِيَر سائقي سيارات من خمسينيات القرن الماضي. ويشتبه أصحاب المتاجر في أنها تُشترى تحديدًا لأنها غير موجودة على الإنترنت بصيغة رقمية.
- أنفقت Anthropic، المنافس الأقرب لـ OpenAI، عشرات الملايين من الدولارات على شراء كتب، وقطع كعوبها كي تُمسح صفحاتها، ثم تحويلها إلى لبّ ورق. وتقول Anthropic إنها لا تشتري الكتب النادرة أو الأثرية ولا تُتلفها.
- وضع موقع الأخبار التقنية 404 Media جهاز تتبّع داخل طلب لكتاب مستعمل وتتبّعه إلى منشأة لـ Amazon في الولايات المتحدة، حيث كانت الكتب تُفكَّك وتُمسح أيضًا.
كتب الملك العام شيء عادل ومفيد للتعلّم منه. المقصود هنا هو الشهية: حين يشتري مختبرٌ سيرةً منسية لمجرد مسحها، فمن العدل أن نسأل ما الذي يُعدّ أيضًا «بيانات جديدة» لدى الصناعة نفسها.
أين تقع بياناتك أنت
بعض أحدث الكتابة البشرية ليس في مكتبة أصلًا. إنه ما يكتبه الناس ويلصقونه ويرفعونه إلى مساعدات الذكاء الاصطناعي كل يوم. ووفقًا لتقارير The Guardian، على أصحاب حسابات ChatGPT الفردية إلغاء الاشتراك إن لم يرغبوا في استخدام بياناتهم للتدريب (بيانات المؤسسات غير مؤهلة). وأيًّا كان المساعد الذي تستخدمه، ابحث عن ذلك الإعداد في عناصر التحكم في البيانات أو الخصوصية اليوم. وكقاعدة عامة، لا ترفع صورًا لأشخاص آخرين أو عقودًا أو سجلات طبية أو ملفات عملاء إلى أي ذكاء اصطناعي سحابي لا ترتاح لرؤيتها في مجموعة تدريب لديه.
هذا ليس خطرًا افتراضيًا. ففي الأسبوع نفسه، قالت OpenAI إن وكلاء الذكاء الاصطناعي التابعين لها سرّبوا 53 صورة تعود لمستخدمي ChatGPT، وهي صور استطاع الوكلاء الوصول إليها لأن بيانات المستخدمين الأفراد تُستخدم في جزء من عملية التدريب. وقد تناولنا ذلك في وكلاء OpenAI سرّبوا صور 53 مستخدمًا من مستخدمي ChatGPT.
النصف الآخر من الصورة أكثر هدوءًا: التطبيقات على جهاز الـ Mac التي ترسل بيانات لم تكتبها أصلًا، مثل التحليلات، وتقارير الأعطال، وإشارات الاستخدام، ومعرّفات الإعلانات. هذا التدفق يغذّي اقتصاد وسطاء البيانات الموصوف في مقالنا عن وسطاء البيانات وجهاز الـ Mac.
ما يفعله FireAI في الجزء الذي تتحكم فيه
لا علاقة لـ FireAI بصفقة أكسفورد وOpenAI، ولا يستطيع أي جدار حماية استرجاع شيء رُفع مسبقًا. ما يغيّره FireAI هو ما يحدث على جهاز الـ Mac الخاص بك من الآن فصاعدًا:
- يعمل الذكاء الاصطناعي الخاص بـ FireAI بالكامل على جهاز الـ Mac. تُحلَّل الاتصالات التي يشرحها والقواعد التي يقترحها محليًا، ولا تُرسل أبدًا إلى HisnLabs، ولا إلى ذكاء اصطناعي سحابي، ولا إلى مجموعة تدريب لأي أحد.
- تُظهر خريطة العالم كل اتصال تجريه تطبيقاتك ووجهته، بما في ذلك تطبيق ChatGPT أو أي تطبيق ذكاء اصطناعي آخر، فترى أي التطبيقات ترسل بيانات أصلًا.
- تتيح لك القواعد الخاصة بكل تطبيق حظر تطبيق، أو نطاق واحد فقط يتحدث إليه، دون تعطيل بقية جهاز الـ Mac.
- يحظر وضع الحذر الشديد (Paranoid) وجهات القياس عن بُعد والتحليلات المعروفة لكل تطبيق لم تسمح له صراحةً، فتبقى على جهاز الـ Mac البيانات الخلفية التي لم تختر مشاركتها قط.
المكتبات تقرر ما تفعله بكتبها. وأنت تقرر ما يغادر جهاز الـ Mac. نزّل FireAI وجرّبه مجانًا لمدة 17 يومًا، أو اقرأ الوثائق أولًا. FireAI من صنع HisnLabs.