Анализ авторства текста
Анализ авторства текста — это область филологии, компьютерной лингвистики и криминалистики, занимающаяся установлением автора письменного произведения на основе анализа его стилистических, лексических, грамматических и иных характеристик. Целью анализа может быть как идентификация автора (атрибуция), так и верификация (подтверждение или опровержение авторства) или профилирование (определение характеристик автора: пола, возраста, образования, региона проживания). Методы анализа варьируются от традиционного филологического анализа до применения статистических и машинно-обучаемых алгоритмов.
История
Ранние этапы
Первые попытки атрибуции текстов относятся к античности, когда филологи пытались определить подлинность авторства древних рукописей (например, гомеровских поэм). В Средние века и Новое время атрибуция основывалась на исторических и биографических данных, а также на интуитивной оценке стиля. В XIX веке, с развитием филологии, появились первые систематические подходы: анализ длины предложений, частоты употребления союзов и предлогов.
Становление научного подхода
В 1851 году английский математик и филолог Август де Морган предложил использовать среднюю длину слова как статистический показатель для атрибуции. В 1887 году американский филолог Томас Менденхолл применил частотный анализ слов для определения авторства пьес Шекспира. В начале XX века русский лингвист Александр Пешковский разработал методы стилистического анализа, а в 1960-х годах с развитием вычислительной техники началось использование компьютерных методов.
Современный этап
С 1990-х годов, с ростом объёмов цифровых текстов и развитием методов машинного обучения, анализ авторства стал активно применяться в криминалистике, журналистике, литературоведении и борьбе с плагиатом. В 2000-х годах появились специализированные программы и онлайн-сервисы (например, JGAAP, stylo, Authorship Analyzer). В 2010-х годах методы глубокого обучения (нейронные сети) позволили достичь высокой точности атрибуции на больших корпусах текстов.
Методы анализа
Филологические методы
- Лексический анализ: выявление характерных слов, терминов, неологизмов, архаизмов, диалектизмов.
- Синтаксический анализ: изучение структуры предложений, типов придаточных, порядка слов, использования союзов.
- Стилистический анализ: оценка образности, метафор, риторических фигур, интонации.
- Тематический анализ: выявление ключевых тем и мотивов, характерных для автора.
Статистические методы
- Частотный анализ: подсчёт частоты употребления служебных слов (предлогов, союзов, частиц), знаков препинания, длины слов и предложений.
- N-граммы: анализ последовательностей символов или слов (биграммы, триграммы). Например, частота биграмм «в», «на», «не» может быть характерна для конкретного автора.
- Метод Бёрроуза: анализ частоты повторения слов в тексте (лексическое разнообразие).
- Кластерный анализ: группировка текстов по сходству стилистических признаков.
Машинное обучение и нейросети
- Метод опорных векторов (SVM): классификация текстов по набору признаков (частота слов, длина предложений).
- Наивный байесовский классификатор: вероятностная оценка авторства на основе частотности слов.
- Нейронные сети (LSTM, Transformer): модели, обучающиеся на последовательностях символов или слов, способные улавливать сложные стилистические паттерны. Например, модель BERT может достигать точности более 90% на задачах атрибуции.
- Стилометрия: использование численных показателей (например, индекс Флеша-Кинкейда, средняя длина слова) для построения «стилистического профиля» автора.
Применение
Литературоведение и текстология
- Установление авторства анонимных или псевдонимных произведений (например, «Слово о полку Игореве», «Тихий Дон»).
- Атрибуция фрагментов переписки, дневников, черновиков.
- Выявление подделок и мистификаций (например, «Краледворская рукопись»).
Криминалистика и судебная экспертиза
- Идентификация авторов анонимных писем, угроз, клеветнических материалов.
- Анализ текстов экстремистской направленности (организации, признанные экстремистскими и запрещённые в РФ, например, ИГИЛ — террористическая организация, запрещена в РФ; движение ЛГБТ — признано экстремистским и запрещено в РФ).
- Установление авторства в делах о плагиате, нарушении авторских прав.
Журналистика и расследования
- Проверка подлинности интервью, мемуаров, публичных заявлений.
- Атрибуция анонимных колонок, блогов, постов в социальных сетях.
- Выявление фейковых новостей и дезинформации.
Борьба с плагиатом
- Системы «Антиплагиат» и Turnitin используют методы анализа авторства для выявления заимствований.
- Сравнение стиля текста с известными работами автора для обнаружения недобросовестного использования.
Проблемы и ограничения
Стилистическая изменчивость
Автор может менять стиль в зависимости от жанра, темы, аудитории или настроения. Например, научная статья и личное письмо одного автора могут сильно различаться.
Малый объём текста
Для точной атрибуции требуется достаточный объём текста (обычно не менее 500–1000 слов). На коротких текстах (менее 100 слов) точность резко падает.
Сознательное искажение стиля
Автор может намеренно подражать другому стилю, использовать псевдоним, редактировать текст под чужие стандарты (например, литературных редакторов).
Культурные и языковые различия
Методы, разработанные для одного языка, могут быть неэффективны для другого. Например, русский язык с его богатой морфологией требует учёта окончаний и падежей.
Технические ограничения
- Ошибки распознавания текста (OCR) могут искажать статистические показатели.
- Наличие в тексте цитат, формул, таблиц может влиять на результаты.
Примеры известных исследований
Атрибуция «Тихого Дона»
В 1970-х годах норвежский славист Гейр Хетсо с помощью компьютерного анализа установил, что автором романа «Тихий Дон» является Михаил Шолохов, а не другие претенденты (например, Фёдор Крюков). Анализ проводился по частоте употребления служебных слов и длине предложений.
Атрибуция «Слова о полку Игореве»
В 2010-х годах группа исследователей из России и США использовала методы стилометрии для сравнения «Слова о полку Игореве» с другими древнерусскими текстами. Результаты показали высокую степень сходства с «Задонщиной» и другими памятниками, что подтвердило подлинность памятника.
Идентификация авторов анонимных писем
В 2018 году в США с помощью анализа авторства было установлено, что анонимные письма с угрозами, направленные в адрес политиков, были написаны одним человеком, который впоследствии был осуждён.
Инструменты и программное обеспечение
- JGAAP (Java Graphical Authorship Attribution Program) — открытая платформа для атрибуции текстов, поддерживающая множество методов.
- Stylo — пакет для языка R, предназначенный для стилометрического анализа.
- Authorship Analyzer — онлайн-сервис, использующий методы машинного обучения.
- Python-библиотеки: scikit-learn (SVM, наивный байес), NLTK, spaCy, TensorFlow/PyTorch (нейронные сети).
- Антиплагиат — российская система, использующая методы анализа авторства для выявления заимствований.
Критика
Анализ авторства текста не является абсолютно точным методом. Критики указывают на следующие недостатки:
- Субъективность филологических методов: разные эксперты могут давать разные оценки.
- Статистическая погрешность: на малых выборках или при наличии шума результаты могут быть случайными.
- Этические проблемы: использование анализа авторства без согласия автора может нарушать право на анонимность и приватность.
- Судебная практика: в ряде стран (включая Россию) результаты компьютерного анализа авторства не признаются судами в качестве доказательства, если не подкреплены другими экспертизами.
Перспективы развития
С развитием искусственного интеллекта и больших языковых моделей (GPT, BERT, YandexGPT) методы анализа авторства становятся всё более точными. Ожидается, что в будущем:
- Появятся системы, способные атрибутировать тексты объёмом менее 100 слов.
- Будет разработана защита от сознательного искажения стиля (например, с помощью генеративных моделей).
- Анализ авторства будет интегрирован в системы проверки подлинности документов и борьбы с дезинформацией.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →