Автоматическое реферирование
Автоматическое реферирование (автоматическая генерация рефератов, суммаризация текста) — это область компьютерной лингвистики и искусственного интеллекта, занимающаяся созданием сжатых версий исходных текстов (документов, статей, новостей, книг) с сохранением их основного смыслового содержания. Целью автоматического реферирования является сокращение объёма текста при минимальной потере ключевой информации.
История
Первые исследования в области автоматического реферирования начались в 1950-х годах, вскоре после появления цифровых компьютеров. В 1958 году Ханс Петер Лун (Hans Peter Luhn) из IBM предложил один из первых методов — выделение наиболее значимых предложений на основе частоты встречаемости слов. Этот подход, основанный на статистическом анализе, заложил основы экстрактивного реферирования.
В 1960-х годах Гарольд Борко (Harold Borko) и другие исследователи развивали методы, использующие синтаксический анализ и ключевые слова. Однако до 1990-х годов развитие технологии сдерживалось ограниченными вычислительными мощностями и отсутствием больших размеченных корпусов текстов.
Переломным моментом стало проведение в 2001 году конференции Document Understanding Conference (DUC), организованной Национальным институтом стандартов и технологий США (NIST). DUC и последующие конференции (TAC — Text Analysis Conference) предоставили стандартизированные наборы данных и метрики для оценки качества рефератов, что стимулировало развитие методов машинного обучения.
В 2010-х годах с появлением глубоких нейронных сетей, особенно архитектур на основе трансформеров (например, BERT, GPT, T5), качество автоматического реферирования значительно возросло. Модели научились не только выбирать предложения, но и генерировать новый текст, перефразируя исходный.
Классификация методов
Методы автоматического реферирования делятся на два основных подхода: экстрактивный и абстрактивный.
Экстрактивное реферирование
Экстрактивные методы работают по принципу выделения наиболее важных предложений, фраз или слов из исходного текста и их компоновки в реферат. Реферат состоит из фрагментов оригинала, без перефразирования. Основные этапы:
- Предобработка текста: удаление стоп-слов, токенизация, лемматизация.
- Построение признаков: оценка каждого предложения по ряду критериев (частота слов, положение в тексте, длина, наличие ключевых терминов, сходство с заголовком).
- Ранжирование: сортировка предложений по сумме признаков.
- Отбор: выбор топ-N предложений для формирования реферата.
Примеры методов:
- TextRank: графовый алгоритм, основанный на PageRank, где вершины — предложения, а рёбра — их семантическое сходство.
- Latent Semantic Analysis (LSA): метод, использующий сингулярное разложение матрицы «термин-документ» для выявления скрытых тем.
- TF-IDF: оценка важности слов на основе их частоты в документе и обратной частоты в коллекции.
Абстрактивное реферирование
Абстрактивные методы генерируют новый текст, который может содержать перефразирование, синонимы и обобщения, не совпадающие дословно с исходным. Этот подход ближе к человеческому реферированию, но сложнее в реализации. Основные этапы:
- Понимание: кодирование исходного текста в векторное представление (эмбеддинг).
- Генерация: декодирование нового текста на основе этого представления, часто с использованием механизма внимания (attention).
Примеры методов:
- Sequence-to-Sequence (Seq2Seq) с LSTM: классическая архитектура рекуррентных нейронных сетей для задач перевода и реферирования.
- Transformer-based модели (BERT, GPT, T5, BART, Pegasus): современные модели, обучаемые на больших корпусах текстов. Модель Pegasus (2020 год) специально разработана для абстрактивного реферирования и использует предобучение на задаче восстановления замаскированных предложений.
- Fine-tuning: дообучение предобученных моделей на специализированных датасетах (например, CNN/DailyMail, Newsroom, XSum).
Применение
Автоматическое реферирование широко используется в различных областях:
- Новостные агрегаторы: создание кратких сводок новостных статей (например, Google News, Яндекс.Новости). Пользователь получает суть события без чтения полного текста.
- Поисковые системы: формирование сниппетов — кратких фрагментов страниц, отображаемых в результатах поиска.
- Научные исследования: генерация аннотаций к научным статьям, обзоров литературы, помощь в анализе больших объёмов публикаций.
- Юридическая и медицинская документация: сокращение объёмных отчётов, судебных решений, историй болезни до ключевых фактов.
- Корпоративные системы: автоматическое создание протоколов совещаний, резюме переписок, аналитических отчётов.
- Образование: создание конспектов учебных материалов.
Оценка качества
Для оценки качества автоматических рефератов используются автоматические метрики и человеческая оценка.
Автоматические метрики
- ROUGE (Recall-Oriented Understudy for Gisting Evaluation): наиболее распространённая метрика, сравнивающая n-граммы (последовательности слов) в сгенерированном реферате с эталонными рефератами, написанными людьми. Основные варианты: ROUGE-1 (униграммы), ROUGE-2 (биграммы), ROUGE-L (наибольшая общая подпоследовательность).
- BLEU (Bilingual Evaluation Understudy): метрика, изначально разработанная для машинного перевода, но также применяемая для реферирования. Оценивает точность совпадения n-грамм.
- METEOR: метрика, учитывающая синонимы и стемминг, что делает её более устойчивой к перефразированию.
- BERTScore: современная метрика, использующая эмбеддинги BERT для оценки семантического сходства между рефератом и эталоном.
Человеческая оценка
Человеческая оценка проводится по нескольким критериям:
- Информативность (informativeness): насколько полно реферат передаёт ключевые факты исходного текста.
- Связность (coherence): насколько логично и последовательно изложен текст.
- Грамматическая корректность (fluency): отсутствие ошибок, естественность языка.
- Краткость (conciseness): отсутствие избыточной информации.
Ограничения и критика
Несмотря на значительный прогресс, автоматическое реферирование имеет ряд ограничений:
- Потеря контекста: особенно при экстрактивном подходе, когда вырванные из контекста предложения могут искажать смысл.
- Галлюцинации: абстрактивные модели могут генерировать факты, которых нет в исходном тексте, что критично для новостей и научных данных.
- Неспособность к глубокому анализу: модели не понимают подтекст, иронию, эмоциональную окраску.
- Зависимость от обучающих данных: качество реферата сильно зависит от того, на каких данных обучалась модель. Смещение в данных может привести к искажению информации.
- Проблема длины: короткие рефераты могут быть слишком обобщёнными, а длинные — содержать шум.
Интересные факты
- Первый патент на устройство для автоматического реферирования был выдан в 1958 году изобретателю Э. Л. Хартли (E. L. Hartley) в США.
- В 2019 году компания Google представила модель Pegasus, которая на тот момент достигла наилучших результатов на нескольких эталонных наборах данных (CNN/DailyMail, XSum).
- В России разработкой методов автоматического реферирования занимаются в Институте проблем передачи информации имени А. А. Харкевича РАН (ИППИ РАН), на факультете компьютерных наук НИУ ВШЭ, а также в компаниях Яндекс и Сбер.
Источники
- Luhn, H. P. (1958). The automatic creation of literature abstracts. IBM Journal of Research and Development, 2(2), 159-165.
- Mihalcea, R., & Tarau, P. (2004). TextRank: Bringing order into text. Proceedings of the 2004 Conference on Empirical Methods in Natural Language Processing.
- Rush, A. M., Chopra, S., & Weston, J. (2015). A neural attention model for abstractive sentence summarization. Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing.
- See, A., Liu, P. J., & Manning, C. D. (2017). Get to the point: Summarization with pointer-generator networks. Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics.
- Zhang, J., Zhao, Y., Saleh, M., & Liu, P. (2020). Pegasus: Pre-training with extracted gap-sentences for abstractive summarization. Proceedings of the 37th International Conference on Machine Learning.
- Lin, C. Y. (2004). ROUGE: A package for automatic evaluation of summaries. Proceedings of the Workshop on Text Summarization Branches Out.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →