Prawo Zipfa: co oznacza ta metryka w analizie tekstu
Prawo Zipfa — empiryczna obserwacja: w naturalnym tekście częstotliwość słowa jest odwrotnie proporcjonalna do jego miejsca w rankingu częstotliwości. Najczęstsze słowo występuje około dwa razy częściej niż drugie, trzy razy częściej niż trzecie i tak dalej.
Skąd się wzięło
Regularność opisał językoznawca George Zipf w pierwszej połowie XX wieku, a później znaleziono ją daleko poza językiem — w rozmiarach miast, dochodach, odwiedzalności stron. Dla tekstów utrzymuje się ona zdumiewająco stabilnie: w każdym wystarczająco dużym naturalnym tekście rozkład częstotliwości układa się na tę samą krzywą.
Po co to w narzędziach SEO
Odchylenie od krzywej — pośredni znak, że tekst został napisany w niezbyt zwykły sposób: przesycony słowami kluczowymi, zebrany z szablonów lub wygenerowany. Dlatego wskaźnik ten jest używany w analizie tekstu: w naszym detektorze tekstów AI jest jednym z trzynastu niezależnych metryk i odpowiada za rozkład częstotliwości słów.
Praktyczna użyteczność dla tekstów
- Diagnoza przesycenia: jeśli słowo kluczowe odbiega od rozkładu, powtarza się zbyt często — to widać również w analizie gęstości.
- Ocena bogactwa słownictwa: płaski rozkład mówi o ubogim języku.
- Porównanie z konkurencją: bardziej użyteczne niż abstrakcyjne normy — zobacz, jak wyglądają teksty z topu.
Prosty przykład
Weź dowolny duży tekst i policz częstotliwości słów. Górne pozycje prawie zawsze zajmą słowa funkcjonalne — przyimki, spójniki, zaimki — a ich częstotliwości będą malały według przewidywalnej krzywej. Znaczące słowa tematu znajdują się niżej, a ich udział pokazuje, o czym jest tekst. Jeśli jednak słowo tematyczne nagle znajduje się na samej górze obok przyimków, to jest to przesycenie, widoczne bez żadnych narzędzi.
Czego prawo nie robi
Nie wpływa bezpośrednio na ranking i nie jest czynnikiem. To narzędzie pomiarowe, a nie zasada, której należy przestrzegać: dostosowywanie tekstu do krzywej jest bezsensowne.