Закон Ципфа: что означает эта метрика в анализе текста
Закон Ципфа — эмпирическое наблюдение: в естественном тексте частота слова обратно пропорциональна его месту в рейтинге частот. Самое частое слово встречается примерно вдвое чаще второго, втрое чаще третьего и так далее.
Откуда он взялся
Закономерность описал лингвист Джордж Ципф в первой половине двадцатого века, а позже её нашли далеко за пределами языка — в размерах городов, доходах, посещаемости сайтов. Для текстов она держится удивительно устойчиво: на любом достаточно большом естественном тексте распределение частот ложится на одну и ту же кривую.
Зачем это в SEO-инструментах
Отклонение от кривой — косвенный признак того, что текст писали не совсем обычным способом: переспамили ключевыми словами, собрали из шаблонов или сгенерировали. Поэтому показатель используют в анализе текста: в нашем детекторе ИИ-текста он одна из тринадцати независимых метрик и отвечает за распределение частот слов.
Практическая польза для текстов
- Диагностика переспама: если ключевое слово выбивается из распределения, оно повторяется слишком часто — это видно и анализом плотности.
- Оценка словарного богатства: плоское распределение говорит о бедном языке.
- Сравнение с конкурентами: полезнее абстрактных норм — смотрите, как выглядят тексты из топа.
Простой пример
Возьмите любой большой текст и посчитайте частоты слов. Верхние позиции почти всегда займут служебные слова — предлоги, союзы, местоимения, — и их частоты будут убывать по предсказуемой кривой. Значимые слова темы располагаются ниже, и именно их доля показывает, о чём текст. Если же тематическое слово вдруг оказывается в самом верху рядом с предлогами, это и есть переспам, видимый без всяких инструментов.
Чего закон не делает
Он не влияет на ранжирование напрямую и не является фактором. Это измерительный инструмент, а не правило, которому нужно соответствовать: подгонять текст под кривую бессмысленно.