Малышовый лепет: как Чуковский моделирует детскую речь
Частотность суффиксов и приставок
В 1928 году Корней Чуковский выпустил книгу «От двух до пяти». В эпоху расцвета идеологизированного советского новояза писатель обратился к совершенно иной теме, создав пронзительное исследование глубинных потребностей и поисков детской души. Безусловно, впоследствии этот фундаментальный труд стал неисчерпаемым источником вдохновения для многих авторов, пишущих для детей и о детях. Мне же стало любопытно взглянуть на книгу через призму Python: проанализировать, как именно Чуковский моделирует детскую речь и за счет чего она звучит так органично, забавно и поучительно.
Для начала я выгрузил текст произведения с ресурса royallib.com, привел его к единой кодировке, нижнему регистру и с помощью регулярных выражений очистил от всех знаков, кроме кириллицы.
Книга изобилует оригинальными, необычными словообразованиями, которые автор относит к категории «детского языка», хотя порой ирония в них понятна исключительно взрослому читателю.
Юра с гордостью считал, что у его няни самая выдающаяся полнота. Но однажды в парке он увидел женщину еще внушительнее.
— Эта тетя заднее тебя, — с укором заметил он своей няне.
Я решил разобраться, какие лингвистические механизмы использует Чуковский для создания «детских» неологизмов. С помощью написанного кода я анализирую структуру слов, классифицируя их на общеупотребительные и окказиональные (авторские инновации), а также вычисляю частотность морфем. Логика алгоритма такова: если морфологический анализатор с высокой степенью уверенности (score > 0,85) распознает слово как нормативное, оно помечается как «норма». Если же показатель уверенности низок или слово не совпадает с леммой, алгоритм классифицирует его как детское новообразование.
def extract_morphology(word):
w = word.lower()
# Префиксы
prefs = [p for p in PREFIXES if w.startswith(p)]
# суффиксы
suffs = [s for s in SUFFIXES if w.endswith(s)]
stem = w
for p in sorted(prefs, key=len, reverse=True):
if w.startswith(p): stem = w[len(p):]; break
base = stem
for s in sorted(suffs, key=len, reverse=True):
if stem.endswith(s): base = stem[:-len(s)]; break
parse = morph.parse(w)[0]
norm = parse.normal_form
pos = parse.tag.POS
score = parse.score
return {
'word': word, 'prefix': ', '.join(prefs) or '-', 'suffix': ', '.join(suffs) or '-',
'base': base, 'stem': stem, 'normal_form': norm, 'pos': pos, 'score': score
}
df = pd.DataFrame([extract_morphology(w) for w in INNOVATIONS])
Проведенный анализ позволил выделить топ-3 наиболее продуктивных суффиксов. В этом и заключается секрет лингвистического мастерства Чуковского: любой взрослый, сохранивший живую память о детстве, мгновенно узнает в этих структурах логику собственного раннего мышления.

Любопытно, что показатель score в pymorphy3 — это не абсолютная вероятность, а коэффициент уверенности анализатора, опирающийся на частотность слов в обучающем корпусе. Общеупотребительные формы имеют вес, стремящийся к 1.0, тогда как отклонения от стандартных парадигм склонения получают более низкие баллы. Кроме того, библиотека задействует марковскую модель для оценки совместимости морфем.
— Подай мне нитку, я буду нанитывать бусы.
Полученные метрики наглядно иллюстрируют механизм детского словотворчества, который стал фундаментом для целого пласта детской литературы и фольклора. Дети не просто имитируют речь — они активно тестируют лингвистические гипотезы: «если к основе прибавить «-ник», получится обозначение деятеля». Для нас, взрослых, очевидно: создание новых слов — это не только забавная фонетическая игра, но и процесс освоения социальных ролей. Поразительно, что Чуковский сумел так точно и чутко зафиксировать эти тонкие психолингвистические процессы в неспокойные 1920-е годы.
Имитационное моделирование дифференциально-фазной защиты линий в REPEAT VISION
Автомобильный голос
Математическая семья за 20 лет решила важнейшую задачу теории групп
Рост результатов ЕГЭ по математике на 20 баллов за 10 лет: закономерность или скачок качества образования?
Изнанка ИИ: как нейросети делают оружием и как этому противостоять
Бортовые компьютеры космоса
ИИ научились не врать, а говорить
Расчет и 3D-визуализация электрического поля заряженных пластин на Python