ملف robots.txt: إيه اللي يتكتب فيه وإيه اللي يبوّظ أرشفتك
ملف robots.txt هو ملف نصي بسيط في جذر موقعك (yoursite.com/robots.txt) بيقول لروبوتات محركات البحث أنهي أجزاء من موقعك تقدر تزورها وأنهي لأ. بيستخدم أوامر قليلة: `User-agent` لتحديد الروبوت، و`Disallow` لمنع مسار، و`Allow` للسماح باستثناء، و`Sitemap` لإعطاء رابط خريطة الموقع. أهم حاجة تفهمها إن الملف ده بيتحكم في الزحف مش في الفهرسة، وغلطة سطر واحد فيه (زي `Disallow: /`) ممكن تمنع جوجل من موقعك كله. هاشرحلك الأوامر، نموذج لووردبريس والمتاجر، الاختبار، والأخطاء اللي بتبوّظ أرشفتك.
محتويات المقال
إيه هو ملف robots.txt وبيعمل إيه؟
أي روبوت محترم (زي Googlebot) بيزور موقعك بيبدأ بيدوّر على الملف ده، ويقرا التعليمات قبل ما يزحف. هو بيشبه لافتة «مسموح الدخول هنا / ممنوع هناك».
مهم جدًا تفهم:
- هو إرشاد مش حماية. الروبوتات المحترمة بتلتزم، لكن الملف مش بيمنع حد من فتح الصفحة، ولا بيحمي معلومات حساسة. لو في صفحة سرية، اتحمي بباسورد مش بـ robots.txt.
- بيمنع الزحف مش الفهرسة. لو صفحة ممنوعة في robots.txt لكن مواقع تانية بتشاور عليها، جوجل ممكن يفهرس رابطها (بدون محتواها). ولو عايز تمنع الظهور في النتايج، الأنسب استخدام وسم `noindex` على الصفحة نفسها (ولازم تسمح بالزحف عشان جوجل يشوف الوسم).
- لو مفيش ملف، الروبوتات بتزحف عادي على كل حاجة متاحة. يعني الملف اختياري، لكنه مفيد للمواقع الكبيرة والمتاجر.
والمصدر الرسمي لتفاصيل الصياغة هو توثيق جوجل لملف robots.txt. اقرأه كمرجع.
الأوامر الأساسية في ملف robots.txt
الملف بيتكون من مجموعات، كل مجموعة تبدأ بـ `User-agent`:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://yoursite.com/sitemap_index.xml
- `User-agent`: مين الروبوت المقصود. `*` معناها كل الروبوتات. ممكن تحدد روبوت بعينه زي `Googlebot`.
- `Disallow`: مسار ممنوع زحفه. `Disallow: /private/` يمنع كل ما يبدأ بـ `/private/`. وسطر `Disallow:` فاضي معناه «مسموح بكل حاجة».
- `Allow`: استثناء داخل مسار ممنوع.
- `Sitemap`: رابط خريطة الموقع (لازم رابط كامل مع https). بيساعد الروبوتات تلاقي صفحاتك.
- الأنماط: `*` بتعني أي نص، و`$` بتعني نهاية الرابط. مثال: `Disallow: /*.pdf$` يمنع ملفات PDF.
- التعليقات: أي سطر يبدأ بـ `#` بيتتجاهل.
الأسماء حساسة لحالة الأحرف في المسارات، والملف لازم يكون في الجذر باسم `robots.txt` بالظبط.
نموذج robots.txt لووردبريس
نموذج بسيط وشائع (عدّله حسب موقعك، وما تنسخوش من غير فهم):
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://yoursite.com/sitemap_index.xml
وده معناه: امنع لوحة الإدارة، واسمح بملف admin-ajax اللي بتحتاجه بعض الوظايف، وأعطِ رابط الخريطة. ووردبريس بيولّد ملف افتراضي افتراضيًا لو مفيش ملف فعلي، وإضافات السيو (Yoast وRank Math) بتخلّيك تعدّله من اللوحة. Yoast ولا Rank Math.
ما تمنعش مجلدات الـ CSS والجافاسكريبت اللي الموقع محتاجها للعرض (مثل `/wp-content/themes/` أو `/wp-includes/`)، لأن جوجل لازم يقدر يعرض الصفحة زي ما المستخدم بيشوفها عشان يفهمها صح.
نموذج للمتاجر (ووكومرس)
المتاجر فيها صفحات ما بتفيدش في البحث (سلة، دفع، حسابي) وفلاتر بتولّد روابط كتيرة:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /*?add-to-cart=*
Disallow: /*?orderby=*
Sitemap: https://yoursite.com/sitemap_index.xml
لاحظ:
- أسماء الصفحات (cart, checkout, my-account) بتختلف حسب إعدادات موقعك ولغتك. اتأكد من روابطك الفعلية قبل أي سطر.
- منع معاملات الفلاتر والترتيب بيقلل زحف روابط متكررة، لكن متمنعش معاملات بتستخدمها كروابط مهمة. ولو عندك صفحات فلتر مفيدة للبحث (مثلًا «ماركة + نوع»)، فكّر في إستراتيجية مختلفة.
- بدائل المنع الكامل: وسم `canonical` أو `noindex` للصفحات الثانوية حسب الحالة. التفاصيل في سيو المتاجر الإلكترونية والمحتوى المكرر في المتاجر.
إزاي تنشئ الملف وترفعه
في ووردبريس:
- لو بتستخدم Yoast أو Rank Math، دوّر على محرر الملفات (File editor / Tools) في الإضافة وعدّل فيه.
- أو أنشئ ملف نصي باسم `robots.txt` وارفعه لجذر الموقع (نفس مكان `wp-config.php`) عبر مدير الملفات أو FTP.
- اتأكد إن ما فيش تعارض بين ملف فعلي والملف الافتراضي الظاهري.
بعد الحفظ:
- افتح `yoursite.com/robots.txt` في المتصفح وتأكد إنه بيظهر صح.
- اتأكد إن مفيش إعداد في ووردبريس (الإعدادات ← القراءة) بيقول «تثبيط محركات البحث من فهرسة الموقع» وهو مفعّل بالغلط، لأنه بيضيف منع للموقع كله.
اختبار الملف
قبل ما تعتمد على أي تعديل:
- افتح الملف في المتصفح وراجعه بالعين.
- استخدم أداة فحص robots.txt في Google Search Console (تقرير robots.txt) عشان تشوف إن جوجل قرأه وهل فيه أخطاء. دليل Google Search Console.
- افحص رابط محدد بأداة فحص الروابط (URL Inspection) في Search Console لتعرف هل هو ممنوع بسبب robots.txt.
- اختبر الصفحات المهمة (الرئيسية، التصنيفات، أهم المنتجات) والتأكد إنها مش ممنوعة.
- راجع بعد أي تغيير كبير في الموقع أو نقله.
الأخطاء اللي بتبوّظ أرشفتك
- `Disallow: /` على الموقع كله: بيمنع كل الزحف. بيحصل كتير في مواقع التطوير (staging) وبعدين بيتنقل للموقع الحقيقي بالغلط. دايمًا راجع الملف بعد النقل. نقل موقع ووردبريس.
- منع الـ CSS والـ JS: جوجل مش هيقدر يعرض الصفحة ويفهمها.
- استخدام robots.txt بدل noindex لإخفاء صفحة من النتايج: ممكن تفضل ظاهرة كرابط بدون وصف.
- منع صفحة عليها noindex: لو منعت زحفها، جوجل مش هيشوف الوسم.
- أخطاء كتابة: مسافات ناقصة، مسارات خطأ، أو أنماط واسعة بتمنع أكتر من المقصود (`Disallow: /p` بتمنع كل المسارات اللي بتبدأ بـ p).
- الاعتماد عليه للحماية: الصفحات السرية محتاجة باسورد.
- الملف مش في الجذر أو باسم غلط.
- ملف ضخم أو معقد بدون داعي.
- ما فيش `Sitemap` أو رابط خريطة قديم.
- تجاهل مشاكل الفهرسة بعد التغيير: راجع الصفحات غير المفهرسة في جوجل لو لاحظت صفحات اختفت.
متى تحتاج تعدّل الملف أصلًا؟
أغلب المواقع الصغيرة محتاجة ملف بسيط جدًا. هتحتاج تعدّل لو:
- عندك متجر بفلاتر وصفحات سلة ودفع.
- موقع كبير وعايز توفّر ميزانية الزحف.
- في أقسام إدارية أو نتائج بحث داخلي مش عايزها تتزحف.
- محتاج تحدد روبوتات معينة (نادرًا).
ولو موقعك صغير، الأفضل تسيب الإعدادات الافتراضية وتركز على المحتوى والسرعة. تعلم السيو من الصفر وقياس سرعة الموقع.
مقالات ذات صلة بتفيدك:
- خريطة الموقع Sitemap: إزاي تعملها وتبعتها لجوجل
- باك لينك: يعني إيه وإزاي تجيب روابط من غير ما تتعاقب
- مايكروسوفت كلاريتي: شوف زوارك بيعملوا إيه في موقعك مجانًا
- ميتا بيزنس سويت: شرح عملي لإدارة صفحتك وانستجرام من مكان واحد
أسئلة شائعة
هل لازم يكون عندي ملف robots.txt؟
لا، غير إجباري. لو مفيش ملف، الروبوتات بتزحف على كل المتاح. لكنه مفيد للمتاجر والمواقع الكبيرة.
ممكن robots.txt يخفي صفحة من جوجل؟
مش مضمون. هو بيمنع الزحف، لكن الرابط ممكن يظهر لو في روابط خارجية. لإخفاء صفحة من النتايج استخدم `noindex`، أو اتحمي بباسورد لو حساسة.
إزاي أعرف إني منعت الموقع بالغلط؟
افتح `yoursite.com/robots.txt` وشوف لو فيه `Disallow: /` تحت `User-agent: *`، وراجع تقرير robots.txt وتقرير الفهرسة في Search Console، وتأكد إن إعداد ووردبريس لإخفاء الموقع من البحث مش مفعّل.
أحط رابط خريطة الموقع في الملف؟
أيوه، سطر `Sitemap:` برابط كامل بيساعد الروبوتات تلاقي صفحاتك، وكمان أرسلها في Search Console.
لو عايز نراجع robots.txt وإعدادات الفهرسة لموقعك أو متجرك قبل ما تخسر صفحات، احجز استشارة ونبدأ.
محتاج حد يبصّ على حساباتك؟
ابعتلي على واتساب وقولّي وضعك، وأقولك نبدأ منين.