Малышовый лепет: как Чуковский моделирует детскую речь

Прокомментировать Просмотры: 7

Частотность суффиксов и приставок

В 1928 году Корней Чуковский выпустил книгу «От двух до пяти». В эпоху расцвета идеологизированного советского новояза писатель обратился к совершенно иной теме, создав пронзительное исследование глубинных потребностей и поисков детской души. Безусловно, впоследствии этот фундаментальный труд стал неисчерпаемым источником вдохновения для многих авторов, пишущих для детей и о детях. Мне же стало любопытно взглянуть на книгу через призму Python: проанализировать, как именно Чуковский моделирует детскую речь и за счет чего она звучит так органично, забавно и поучительно.

Для начала я выгрузил текст произведения с ресурса royallib.com, привел его к единой кодировке, нижнему регистру и с помощью регулярных выражений очистил от всех знаков, кроме кириллицы.

Книга изобилует оригинальными, необычными словообразованиями, которые автор относит к категории «детского языка», хотя порой ирония в них понятна исключительно взрослому читателю.

Юра с гордостью считал, что у его няни самая выдающаяся полнота. Но однажды в парке он увидел женщину еще внушительнее.

— Эта тетя заднее тебя, — с укором заметил он своей няне.

Я решил разобраться, какие лингвистические механизмы использует Чуковский для создания «детских» неологизмов. С помощью написанного кода я анализирую структуру слов, классифицируя их на общеупотребительные и окказиональные (авторские инновации), а также вычисляю частотность морфем. Логика алгоритма такова: если морфологический анализатор с высокой степенью уверенности (score > 0,85) распознает слово как нормативное, оно помечается как «норма». Если же показатель уверенности низок или слово не совпадает с леммой, алгоритм классифицирует его как детское новообразование.

def extract_morphology(word):
    w = word.lower()
    # Префиксы
    prefs = [p for p in PREFIXES if w.startswith(p)]
    # суффиксы
    suffs = [s for s in SUFFIXES if w.endswith(s)]
    stem = w
    for p in sorted(prefs, key=len, reverse=True):
        if w.startswith(p): stem = w[len(p):]; break
    base = stem
    for s in sorted(suffs, key=len, reverse=True):
        if stem.endswith(s): base = stem[:-len(s)]; break
    parse = morph.parse(w)[0]
    norm = parse.normal_form
    pos = parse.tag.POS
    score = parse.score
    return {
        'word': word, 'prefix': ', '.join(prefs) or '-', 'suffix': ', '.join(suffs) or '-',
        'base': base, 'stem': stem, 'normal_form': norm, 'pos': pos, 'score': score
    }
df = pd.DataFrame([extract_morphology(w) for w in INNOVATIONS])

Проведенный анализ позволил выделить топ-3 наиболее продуктивных суффиксов. В этом и заключается секрет лингвистического мастерства Чуковского: любой взрослый, сохранивший живую память о детстве, мгновенно узнает в этих структурах логику собственного раннего мышления.

Соотношение нормативных форм и инноваций
Соотношение нормативных форм и инноваций

Любопытно, что показатель score в pymorphy3 — это не абсолютная вероятность, а коэффициент уверенности анализатора, опирающийся на частотность слов в обучающем корпусе. Общеупотребительные формы имеют вес, стремящийся к 1.0, тогда как отклонения от стандартных парадигм склонения получают более низкие баллы. Кроме того, библиотека задействует марковскую модель для оценки совместимости морфем.

— Подай мне нитку, я буду нанитывать бусы.

Полученные метрики наглядно иллюстрируют механизм детского словотворчества, который стал фундаментом для целого пласта детской литературы и фольклора. Дети не просто имитируют речь — они активно тестируют лингвистические гипотезы: «если к основе прибавить «-ник», получится обозначение деятеля». Для нас, взрослых, очевидно: создание новых слов — это не только забавная фонетическая игра, но и процесс освоения социальных ролей. Поразительно, что Чуковский сумел так точно и чутко зафиксировать эти тонкие психолингвистические процессы в неспокойные 1920-е годы.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов