Стандарт Unicode и кодировка эмодзи¶
Стандарт Unicode — это международный стандарт кодирования символов, позволяющий единообразно представлять текст на всех языках мира, а также знаки препинания, математические символы и пиктограммы (эмодзи). Стандарт разрабатывается и поддерживается некоммерческим консорциумом Unicode Consortium, основанным в 1991 году. Unicode сопоставляет каждому символу уникальный числовой код (кодовую точку) и обеспечивает совместимость с более ранними кодировками, такими как ASCII.
¶История и развитие
Предшественниками Unicode были национальные и региональные кодировки (например, Windows-1251 для кириллицы), которые не могли одновременно отображать символы разных языков. В конце 1980-х годов возникла потребность в универсальной системе. В 1991 году был опубликован первый том стандарта, содержащий около 7 000 символов. К 2024 году стандарт включает более 149 000 символов, охватывающих письменности практически всех живых и многих мёртвых языков мира.
Первоначально предполагалось, что каждый символ будет кодироваться 16 битами (65 536 позиций), однако позже пространство было расширено до 1 114 112 кодовых позиций. Это позволило включить в стандарт исторические письменности, редкие иероглифы и пиктограммы.
¶Кодировки представления
Unicode определяет только соответствие «символ — код». Для хранения и передачи текста используются различные схемы кодирования (UTF):
- UTF-8 — переменная длина (от 1 до 4 байт). Наиболее распространённая кодировка в вебе, полностью совместима с ASCII.
- UTF-16 — переменная длина (2 или 4 байта). Используется в операционных системах Windows и средах Java.
- UTF-32 — фиксированная длина (4 байта). Упрощает обработку текста, но требует больше памяти.
Выбор кодировки не влияет на набор символов, но определяет эффективность хранения и обработки данных.
¶Эмодзи как часть Unicode
Эмодзи — это графические символы (пиктограммы), включённые в стандарт Unicode как обычные символы. Первая партия из 76 эмодзи была добавлена в стандарт в 2010 году (версия 6.0). К 2024 году количество эмодзи превышает 3 600.
¶Структура и классификация
Эмодзи делятся на несколько категорий: смайлики и эмоции, люди и жесты, животные и природа, еда и напитки, путешествия и транспорт, символы и флаги. Каждый эмодзи имеет уникальную кодовую точку, но некоторые могут состоять из нескольких кодов (последовательностей).
¶Механизм модификаторов
Для отображения тона кожи, цвета волос и других вариаций используются модификаторы. Например, базовый символ «👋» (U+1F44B) в сочетании с модификатором тона кожи (U+1F3FB–U+1F3FF) образует варианты с разным цветом кожи. Такие последовательности называются ZWJ-последовательностями (zero-width joiner), когда несколько символов соединяются через специальный невидимый символ U+200D.
¶Флаги и сложные последовательности
Флаги стран кодируются как пара региональных индикаторов (буквы A–Z). Например, флаг России — это последовательность U+1F1F7 (региональный индикатор R) и U+1F1FA (региональный индикатор U). Существуют также составные эмодзи, например, «семья» (👨👩👧) собирается из нескольких символов мужчины, женщины, девочки и соединителей.
¶Проблемы и ограничения
- Отображение на разных платформах. Один и тот же код эмодзи может выглядеть по-разному на устройствах Apple, Android, Windows и в веб-сервисах. Unicode определяет только абстрактный символ, а внешний вид зависит от шрифтов производителя.
- Отсутствие символов. Некоторые языки и редкие символы до сих пор не включены в стандарт, что вызывает дискуссии в консорциуме.
- Семантическая неоднозначность. Эмодзи могут интерпретироваться по-разному в зависимости от контекста и культурных особенностей.
- Совместимость со старыми системами. Некоторые старые программы не поддерживают новые версии Unicode и отображают символы в виде квадратов (так называемые «тофу»).
¶Применение
Unicode является основой для всех современных операционных систем, языков программирования, баз данных и веб-технологий. Стандарт используется в протоколах электронной почты, мессенджерах, социальных сетях и системах электронного документооборота. Эмодзи, в свою очередь, стали неотъемлемой частью цифровой коммуникации: по данным Unicode Consortium, около 92 % интернет-пользователей используют эмодзи в переписке.
¶Критика
Критики отмечают, что процесс добавления новых символов в стандарт занимает годы и подвержен влиянию крупных корпораций. Также высказываются опасения по поводу культурной унификации: стандарт преимущественно ориентирован на западные и восточноазиатские письменности, тогда как письменности Африки и Юго-Восточной Азии представлены слабее.
¶Источники
- The Unicode Standard, Version 15.1 (Unicode Consortium, 2023)
- Unicode Emoji Charts (Unicode Consortium, 2023)
- Документация по UTF-8 и UTF-16 (RFC 3629, RFC 2781)
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


