بحث مفتوح المصدر
SAGE: مراجعة محرك مفتوح المصدر لتدقيق SEO وAEO وGEO
Executive summary
مراجعة مباشرة لمستودع تقي مولوي العام: محرك Python لتدقيق SEO التقني والكيانات والاسترجاع التوليدي.

الخلاصة التنفيذية
يقدم sage-audit محركاً مفتوح المصدر بلغة Python لتدقيق ثلاثة مستويات من الظهور الرقمي: تحسين محركات البحث التقني SEO، وتحسين محركات الإجابة AEO، وتحسين المحركات التوليدية GEO. تعتمد هذه الدراسة على مراجعة مباشرة للمستودع العام tmolavi/sage-audit في 2 سبتمبر 2026.
ينتج كل فحص حالة ودرجة ووزناً ودليلاً وتوصية. وتُحسب الدرجة العامة بوزن 30% لـ SEO و35% لـ AEO و35% لـ GEO.
| المجال | الوحدة | الناتج |
|---|---|---|
| نموذج البيانات | models.py | نتائج وتقارير منظمة |
| SEO | seo_auditor.py | metadata وcanonical وheaders وrobots |
| AEO | aeo_auditor.py | كيانات JSON-LD وFAQ والإجابة المباشرة |
| GEO | geo_auditor.py | مقاطع واسترجاع ومحاكاة وCSP |
| الواجهات | CLI وMCP | طرفية وPython وJSON/Markdown وأدوات الوكلاء |
كيف تعمل الركائز الثلاث؟
يفحص تدقيق SEO العنوان وcanonical وmeta robots وOpen Graph وبنية H1 ونسبة النص إلى الكود وعناوين الأمان والتخزين المؤقت وسياسة روبوتات الذكاء الاصطناعي مثل GPTBot وPerplexityBot وClaudeBot وGoogle-Extended.
يفحص AEO رسم JSON-LD بصورة تكرارية، بما في ذلك Organization وPerson وProduct وArticle وFAQPage، إضافة إلى روابط sameAs وحداثة البيانات وبداية الأقسام وهل تقدم جواباً مباشراً.
يقسم GEO النص إلى مقاطع دلالية تقارب 60–120 token. ويستخدم fastembed أو sentence-transformers، مع fallback حتمي يعتمد على hashed n-gram عند غياب النماذج. ثم يحاكي top-k retrieval ويقيس تشابه cosine والانتروبيا الدلالية واحتمال بقاء الاقتباس CSP.
| طبقة GEO | السؤال | الناتج |
|---|---|---|
| DOM نظيف | هل فُصل النص عن العناصر الزائدة؟ | نص نظيف |
| المقاطع | هل الحدود الدلالية متماسكة؟ | مقاطع 60–120 token |
| المتجهات | كيف تمثل المعاني؟ | متجهات عصبية أو hashing |
| الاسترجاع | أي المقاطع تتقدم؟ | ترتيب top-k |
| الاقتباس | هل المقطع الفائز مميز؟ | CSP وentropy |
نقاط القوة والحدود
أهم قرار تقني هو الاستمرار الآمن عند فشل تنزيل النموذج أو غياب حزمة embedding. كما تجعل نماذج Pydantic التقارير قابلة للمعالجة آلياً، وتغطي الاختبارات غير المتصلة tokenizer والاستخراج وJSON-LD وrobots والركائز الثلاث وCLI.
لكن CSP ليس ضماناً للظهور في Google أو ChatGPT أو Perplexity. ومحاكاة RAG داخل الذاكرة لا تمثل كل أنظمة الاسترجاع الحقيقية. لذلك يجب تسجيل الاستعلام واللغة والبلد والنموذج والتاريخ والمصادر ودقة الحقائق والتحويل التجاري عند القياس الفعلي.
الاستخدام السريع
pip install git+https://github.com/tmolavi/sage-audit.git
sage audit https://example.com
sage audit https://example.com --format markdown -o report.md --save-artifacts ./out
sage generate-llms https://example.com -o llms.txt --also-chunksالنتيجة
يحوّل SAGE مفهوم «الظهور في الذكاء الاصطناعي» إلى ثلاثة أسئلة قابلة للفحص: هل الصفحة متاحة تقنياً؟ هل الكيان وبنية الإجابة واضحان؟ وهل تبقى المقاطع مميزة أثناء الاسترجاع الدلالي؟ قيمته الأساسية ليست وعداً بترتيب معين، بل إطار مفتوح وقابل للتكرار لبناء خط أساس واختبار التحسينات.