Закон Ципфа

Материал из Википедии — свободной энциклопедии
Перейти к: навигация, поиск
Закон Ципфа для русской Википедии

Закон Ципфа — эмпирическая закономерность распределения частоты слов естественного языка: если все слова языка (или просто достаточно длинного текста) упорядочить по убыванию частоты их использования, то частота n-го слова в таком списке окажется приблизительно обратно пропорциональной его порядковому номеру n (так называемому рангу этого слова, см. шкала порядка). Например второе по используемости слово встречается примерно в два раза реже, чем первое, третье — в три раза реже, чем первое, и т. д.

Закон носит имя своего первооткрывателя — американского лингвиста Джорджа Ципфа из Гарвардского университета.

Объяснение закона Ципфа, основанное на корреляционных свойствах аддитивных марковских цепей (со ступенчатой функцией памяти) было дано в работе[1].

Закон Ципфа математически описывается распределением Парето.

Критика[править | править исходный текст]

Американский биолог Ли Вэньтянь попытался[2] опровергнуть закон Ципфа, строго доказав, что случайная последовательность символов также подчиняется закону Ципфа. Автор делает гипотетический вывод, что закон Ципфа, по-видимому, является чисто статистическим феноменом, не имеющим отношения к семантике текста.

В общих чертах доказательство этой теории состоит в следующем. Вероятность случайного появления какого-либо слова длиной n в цепочке случайных символов уменьшается с ростом n в той же пропорции, в какой растет при этом номер этого слова в частотном списке. Потому произведение номера слова на его частоту есть константа.

Примечания[править | править исходный текст]

  1. K. E. Kechedzhy, O.V. Usatenko, V. A. Yampol'skii Rank distributions of words in additive many-step Markov chains and the Zipf law = Arxiv LANL. — 2004.; Phys. Rev. E. – 2005. – V. 72. – P. 046138(1)–046138(6).
  2. Wentian Li Random Texts Exhibit Zipf’s-Law-Like Word Frequency Distribution = IEEE Transactions on Information Theory. — Santa Fe Institute, 1660 Old Pecos Trail, Suite A, Santa Fe, NM 87501, 1992. — В. 38. — № 6. — С. 1842-1845.

См. также[править | править исходный текст]