TanodTools
RU

Счётчик частоты слов

Вставьте текст, чтобы увидеть, какие слова и фразы встречаются чаще всего, с количеством и процентами, и исключите распространённые стоп-слова вашего языка.

Работает в браузере; введённые вами данные не покидают устройство

Считать

Вставьте текст, чтобы начать.

Текст до нескольких миллионов символов. Слова — это последовательности букв и цифр; апострофы и дефисы внутри слова сохраняются, а фразы никогда не переходят через конец предложения или перевод строки. Списки стоп-слов — это короткие перечни самых частых служебных слов, а не полные словари; они есть для английского, испанского, французского, немецкого, португальского (Бразилия), итальянского, индонезийского, турецкого, вьетнамского, русского, польского и хинди.

Как посчитать частоту слов

  1. Вставьте свой текст.
  2. Выберите отдельные слова, фразы из двух слов или из трёх слов и язык стоп-слов, если хотите пропустить такие слова, как the, and или of.
  3. Прочитайте список по убыванию с количеством и процентами, затем скопируйте его или скачайте в формате CSV.

Как считается частота слов

Текст разбивается на слова, каждое слово приводится к нижнему регистру, и инструмент подсчитывает, сколько раз встречается каждое. В списке сначала идут самые частые слова, а при равенстве они упорядочены по алфавиту. Подсчёт повторов — быстрый способ понять, о чём на самом деле текст, проверить, не злоупотребляете ли вы ключевым словом, найти главные термины в интервью или ответах на опрос или заметить привычку, например постоянно опираться на одно и то же слово в сочинении.

Без фильтров в начале списка почти всегда стоят служебные слова вроде the, of и and. Если выбрать язык стоп-слов, они убираются, и вперёд выходят слова с содержанием. Списки включают самые частые артикли, местоимения, предлоги, союзы и вспомогательные глаголы языка и рассчитаны на быстрый взгляд, а не на лингвистическую работу.

Фразы считаются как последовательности из двух или трёх слов подряд внутри одного предложения. Повторяющиеся фразы часто говорят больше, чем отдельные слова: они выдают названия продуктов, слоганы и устойчивые выражения в тексте. При включённых стоп-словах фразы, начинающиеся или заканчивающиеся стоп-словом, отбрасываются, поэтому оставшиеся фразы содержательнее.

Процент элемента — это его количество, делённое на общую сумму подсчитанного. Эта сумма меняется в зависимости от параметров, потому что исключённые стоп-слова и числа не учитываются. Скачайте CSV, чтобы сохранить полный список или построить по нему диаграмму в электронной таблице.

Советы

Вопросы и ответы

Что считается словом?

Последовательность букв или цифр, внутри которой между буквами может стоять апостроф или дефис, поэтому don't и well-known — это по одному слову. Строчные и заглавные буквы считаются одним и тем же словом. Знаки препинания и пробелы разделяют слова.

Как считаются фразы?

Фраза из двух слов — это каждая пара слов, стоящих рядом, а фраза из трёх слов — каждая такая тройка. Фразы не переходят через точку, вопросительный знак, точку с запятой и перевод строки, поэтому последнее слово одного предложения не склеивается с первым словом следующего.

Что делают параметры стоп-слов?

Стоп-слова — это очень частые служебные слова, например the, and, of, el, la, le, der или и. Из списка отдельных слов они исключаются. Для фраз отбрасывается любая фраза, которая начинается или заканчивается стоп-словом, поэтому вы видите фразы вроде search engine, а не of the search. Проценты считаются от того, что осталось.

Как считается процент?

Это количество элемента, делённое на общее число подсчитанных слов (или фраз) после исключения стоп-слов и чисел, если вы так выбрали.

Что находится в файле CSV?

Весь список по убыванию, а не только часть, видимая на экране, со столбцами: место, слово, количество и процент. Файл в кодировке UTF-8 с меткой порядка байтов, чтобы электронные таблицы правильно показывали буквы с диакритикой.

Мой текст загружается куда-то?

Нет. Текст подсчитывается в вашем браузере, и ничего не покидает ваше устройство.