Закон Ципфа: що означає ця метрика в аналізі тексту
Закон Ципфа — емпіричне спостереження: у природному тексті частота слова обернено пропорційна його місцю в рейтингу частот. Найчастіше слово зустрічається приблизно вдвічі частіше другого, втроє частіше третього і так далі.
Звідки він взявся
Закономірність описав лінгвіст Джордж Ципф у першій половині двадцятого століття, а пізніше її знайшли далеко за межами мови — у розмірах міст, доходах, відвідуваності сайтів. Для текстів вона тримається дивовижно стійко: на будь-якому достатньо великому природному тексті розподіл частот лягає на одну й ту ж криву.
Навіщо це в SEO-інструментах
Відхилення від кривої — непрямий показник того, що текст писали не зовсім звичайним способом: переспамили ключовими словами, зібрали з шаблонів або згенерували. Тому показник використовують в аналізі тексту: в нашому детекторі ІІ-тексту він одна з тринадцяти незалежних метрик і відповідає за розподіл частот слів.
Практична користь для текстів
- Діагностика переспаму: якщо ключове слово вибивається з розподілу, воно повторюється занадто часто — це видно і аналізом щільності.
- Оцінка словникового багатства: плоске розподіл говорить про бідну мову.
- Порівняння з конкурентами: корисніше абстрактних норм — дивіться, як виглядають тексти з топу.
Простий приклад
Візьміть будь-який великий текст і порахуйте частоти слів. Верхні позиції майже завжди займуть службові слова — прийменники, сполучники, займенники, — і їх частоти будуть зменшуватися за передбачуваною кривою. Значущі слова теми розташовуються нижче, і саме їхня частка показує, про що текст. Якщо ж тематичне слово раптом опиняється на самому верху поруч з прийменниками, це і є переспам, видимий без жодних інструментів.
Чого закон не робить
Він не впливає на ранжування безпосередньо і не є фактором. Це вимірювальний інструмент, а не правило, якому потрібно відповідати: підганяти текст під криву безглуздо.