Açıq mənbə araşdırması
SAGE: SEO, AEO və GEO üçün açıq mənbəli audit mühərrikinin icmalı
İcra xülasəsi
Taqi Molavinin açıq repozitoriyasına əsaslanan icmal: texniki SEO, varlıq cavabları və generativ axtarış hazırlığı üçün Python mühərriki.

İcra xülasəsi
sage-audit texniki SEO, Answer Engine Optimization (AEO) və Generative Engine Optimization (GEO) qatlarını bir hesabatda yoxlayan Python əsaslı açıq mənbəli layihədir. Bu araşdırma 2 sentyabr 2026-cı ildə tmolavi/sage-audit repozitoriyasının birbaşa təhlili əsasında hazırlanıb.
Layihə hər yoxlama üçün status, bal, çəki, sübut və tövsiyə yaradır. Ümumi bal SEO üçün 30%, AEO üçün 35% və GEO üçün 35% çəkidən formalaşır.
| Sahə | Modul | Əsas nəticə |
|---|---|---|
| Data modeli | models.py | Strukturlaşdırılmış tapıntılar və hesabat |
| SEO | seo_auditor.py | Meta, canonical, header və robots yoxlamaları |
| AEO | aeo_auditor.py | JSON-LD varlıqları, FAQ və birbaşa cavablar |
| GEO | geo_auditor.py | Chunk, retrieval simulyasiyası və CSP |
| İnterfeys | CLI və MCP | Terminal, Python, JSON/Markdown və agent alətləri |
Üç əsas sütun
SEO auditoru canonical, meta robots, Open Graph, H1, mətn-kod nisbəti, təhlükəsizlik/cache başlıqları və GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Amazonbot və Applebot-Extended siyasətlərini yoxlayır.
AEO auditoru JSON-LD qrafını rekursiv oxuyur, Organization, Person, Product, Article və FAQPage kimi varlıqları, sameAs bağlantılarını, təravəti və bölmə başlanğıclarının birbaşa cavab verib-vermədiyini qiymətləndirir.
GEO auditoru mətni təxminən 60–120 tokenlıq semantik hissələrə bölür. fastembed və ya sentence-transformers olmadıqda deterministik hashed n-gram fallback işləyir. Sonra top-k retrieval, kosinus oxşarlığı, semantik entropiya və Citation Survival Probability hesablanır.
| GEO qatı | Sual | Çıxış |
|---|---|---|
| Təmiz DOM | Əsas mətn boilerplate-dan ayrılıb? | Təmiz mətn |
| Semantik hissələr | Passage sərhədləri məntiqlidirmi? | 60–120 token chunk |
| Vektorlar | Məna necə təmsil olunur? | Neural və ya hashing vektorları |
| Retrieval | Hansı hissələr seçilir? | Top-k sıralaması |
| Citation | Qalib hissə nə qədər fərqlidir? | CSP və entropy |
Güclü tərəflər və məhdudiyyətlər
Ən yaxşı texniki seçim graceful fallback-dir: model yüklənməsə və ya embedding paketi qurulmasa, alət dayanmayır. Pydantic hesabatları maşınla oxunaqlı saxlayır, offline testlər isə tokenizer, DOM extraction, JSON-LD, robots, üç auditor və CLI-ı əhatə edir.
CSP Google, ChatGPT və ya Perplexity-də sıralanma zəmanəti deyil. Yaddaşdaxili RAG simulyasiyası bütün provayderlərin real retrieval prosesini təkrarlaya bilməz. Ciddi ölçmə üçün sorğu, dil, ölkə, model, tarix, mənbələr, brend qeydiyyatı, fakt dəqiqliyi və biznes dönüşümü ayrıca saxlanmalıdır.
Sürətli istifadə
pip install git+https://github.com/tmolavi/sage-audit.git
sage audit https://example.com
sage audit https://example.com --format markdown -o report.md --save-artifacts ./out
sage generate-llms https://example.com -o llms.txt --also-chunksNəticə
SAGE “AI görünürlüğü”nü üç yoxlanıla bilən suala çevirir: səhifə texniki baxımdan əlçatandırmı, varlıq və cavab strukturu aydındırmı, pasajlar semantik retrieval zamanı sağ qalırmı? Layihənin əsas dəyəri zəmanətli reytinq deyil, açıq və təkrarlana bilən audit bazasıdır.