Единицы измерения информации¶
Единица измерения информации — это эталонная величина, применяемая для количественного выражения объёма данных и результатов процессов обработки, хранения и передачи информации. В отличие от единиц измерения физических величин, базовая единица информации не является непрерывной: в основе лежит дискретная величина — бит, принимающий одно из двух значений. Производные единицы образуются путём умножения на степени числа 2 (двоичные приставки) либо на степени числа 10 (десятичные приставки), что порождает различия в трактовке одних и тех же наименований.
¶Базовые единицы
Основной единицей является бит (от англ. binary digit — двоичная цифра). Один бит соответствует выбору одного из двух равновероятных состояний: 0 или 1, «да» или «нет», включено или выключено. Бит — минимальная порция информации, которую можно передать или сохранить в цифровой системе.
Более крупная базовая единица — байт. Исторически байт вводился как количество битов, необходимое для кодирования одного символа текста. В большинстве современных вычислительных систем 1 байт равен 8 битам. Именно байт стал практической единицей измерения объёмов файлов, оперативной памяти и пропускной способности каналов.
¶Двоичные и десятичные приставки
Для обозначения больших объёмов применяются приставки двух типов, и их смешение — распространённый источник путаницы.
| Приставка | Обозначение | Множитель | Пример |
|---|---|---|---|
| килобит | кбит | 10³ = 1000 бит | скорость сети |
| килобайт | КБ | 10³ = 1000 байт | десятичная трактовка |
| кибибайт | КиБ | 2¹⁰ = 1024 байт | двоичная трактовка |
| мегабайт | МБ | 10⁶ = 1 000 000 байт | размер файла |
| мебибайт | МиБ | 2²⁰ = 1 048 576 байт | объём памяти |
| гигабайт | ГБ | 10⁹ байт | ёмкость диска |
| гибибайт | ГиБ | 2³⁰ байт | объём ОЗУ |
Двоичные приставки (киби-, меби-, гиби-, теби-) были стандартизированы Международной электротехнической комиссией в 1998 году, чтобы разграничить две системы. Однако на практике в быту и в маркировке носителей до сих пор часто используют десятичные приставки там, где подразумеваются двоичные значения, и наоборот. Так, производители жёстких дисков указывают ёмкость в десятичных гигабайтах, тогда как операционная система отображает объём в двоичных единицах, из-за чего видимая ёмкость оказывается меньше заявленной.
¶Производные и специализированные единицы
Помимо байта и его кратных, применяются единицы, привязанные к конкретным задачам:
- Скорость передачи данных измеряется в битах в секунду (бит/с), килобитах в секунду (Кбит/с), мегабитах в секунду (Мбит/с). Важно различать биты и байты: при скорости 100 Мбит/с за секунду передаётся около 12,5 МБ данных.
- Информационная энтропия в теории информации измеряется в битах, а при использовании натурального логарифма — в натах, при десятичном логарифме — в дитах (хартли).
- Ёмкость запоминающих устройств традиционно выражается в байтах и их кратных, а объём регистров и разрядность процессоров — в битах.
- Символ как единица иногда используется в задачах кодирования, где его информационный вес зависит от мощности алфавита.
¶Соотношение единиц
Связь между единицами внутри одной системы строится на степенях:
- 1 байт = 8 бит;
- 1 КиБ = 1024 байт;
- 1 МиБ = 1024 КиБ;
- 1 ГиБ = 1024 МиБ;
- 1 ТиБ = 1024 ГиБ.
В десятичной системе переход между единицами происходит через множитель 1000. Разница накапливается с ростом величины: если для килобайта расхождение составляет около 2,4 %, то для терабайта оно превышает 9 %.
¶История и стандартизация
Понятие бита ввёл в 1948 году американский инженер Клод Шеннон в работе по теории связи, хотя близкие идеи высказывал ещё в 1940-х годах. Термин «bit» предложил математик Джон Тьюки. Термин «byte» появился в 1956 году в работе Вернера Бухгольца. В ранних вычислительных машинах длина байта варьировалась — встречались 6-, 7- и 9-битные байты; стандарт 8 бит закрепился с распространением архитектуры IBM System/360 и последующих систем.
В 1960 году Международная система единиц (СИ) закрепила десятичные приставки, что впоследствии вошло в противоречие с двоичной природой вычислительной техники. Это противоречие и привело к введению отдельной системы двоичных приставок в 1998 году. В России соответствующие обозначения закреплены в национальных стандартах, гармонизированных с международными.
¶Практическое значение
Корректное использование единиц измерения информации важно при:
- расчёте тарифов на интернет-трафик и хранение данных;
- оценке объёма резервных копий и пропускной способности каналов;
- проектировании баз данных и выборе носителей;
- сопоставлении характеристик оборудования разных производителей.
Ошибки в трактовке приставок приводят к неверным расчётам: например, при закупке дисков «на 1 ТБ» фактический объём в двоичных единицах оказывается около 931 ГиБ. Поэтому в технической документации всё чаще указывают обе величины либо явно применяют двоичные приставки.
¶Интересные факты
- Название «байт» созвучно английскому bite («кусок»), но было изменено в написании, чтобы избежать путаницы с bit.
- В некоторых языках программирования существуют типы данных с фиксированной разрядностью, и информационный вес переменной напрямую выражается в битах.
- Объём человеческого генома в цифровой записи оценивается примерно в 750 МБ при кодировании одной буквы нуклеотида одним байтом.
- Крупнейшие дата-центры оперируют объёмами в эксабайтах (10¹⁸ байт) и зеттабайтах (10²¹ байт).
Источники: стандарты Международной электротехнической комиссии по двоичным приставкам; работы Клода Шеннона по теории информации; национальные стандарты РФ в области информационных технологий; техническая документация производителей вычислительной техники.