Открыть сервис

Машинное обучение на устройстве

Машинное обучение на устройстве (англ. on-device machine learning, on-device ML) — это подход к реализации систем искусственного интеллекта, при котором алгоритмы машинного обучения выполняются непосредственно на конечном устройстве пользователя (смартфоне, планшете, IoT-датчике, автомобильном компьютере), а не на удалённом сервере или в облачной инфраструктуре. Ключевое отличие этого подхода заключается в том, что обученная модель обрабатывает данные локально, без передачи их по сети, что обеспечивает конфиденциальность, низкую задержку и возможность работы в автономном режиме. Машинное обучение на устройстве является одной из ключевых технологий для развития периферийных вычислений (edge computing) и встраиваемых систем.

История

Предпосылки и ранние этапы

До середины 2010-х годов выполнение сложных вычислительных задач, связанных с машинным обучением, было практически невозможно на мобильных и встраиваемых устройствах из-за ограниченных ресурсов процессора, памяти и энергопотребления. Основные вычисления производились в облаке, а на устройство отправлялся лишь результат. Однако рост производительности мобильных процессоров, появление специализированных нейронных процессоров (NPU) и развитие технологий сжатия моделей создали предпосылки для переноса инференса на устройство.

Ключевые вехи

  • 2017 год: Apple представила Core ML — фреймворк для интеграции моделей машинного обучения в приложения iOS. Это стало одним из первых массовых решений для on-device ML на мобильных платформах.
  • 2017 год: Google анонсировала TensorFlow Lite — облегчённую версию фреймворка TensorFlow, оптимизированную для мобильных и встраиваемых устройств.
  • 2018 год: Qualcomm выпустила Snapdragon Neural Processing Engine (SNPE), позволяющий использовать аппаратное ускорение на чипсетах Snapdragon.
  • 2020 год: Появление технологии Federated Learning (федеративное обучение), которая позволяет обучать центральную модель на данных, остающихся на устройствах пользователей, без их передачи на сервер. Этот подход активно внедряется в клавиатурные приложения (например, Gboard).
  • 2023 год: Массовое внедрение генеративных моделей (Large Language Models, LLM) на устройстве. Компании Qualcomm, Apple, Google и Samsung начали оптимизировать модели с миллиардами параметров для работы на смартфонах.

Архитектура и принципы работы

Основные компоненты

Система машинного обучения на устройстве включает три ключевых компонента:

  1. Обученная модель: Предварительно обученная на мощных серверах нейронная сеть, которая затем сжимается и оптимизируется для целевого устройства.
  2. Среда выполнения (Runtime): Специализированное программное обеспечение, которое загружает и выполняет модель на устройстве. Примеры: Core ML (iOS), TensorFlow Lite (Android, Linux), ONNX Runtime (кроссплатформенный).
  3. Аппаратное обеспечение: Для ускорения вычислений используются CPU, GPU (графический процессор) и NPU (нейронный процессор). NPU, встроенный в SoC (систему на кристалле), обеспечивает максимальную производительность при минимальном энергопотреблении.

Процесс обработки

  1. Ввод данных: Пользовательское приложение передаёт данные (изображение, текст, аудио) в среду выполнения.
  2. Предобработка: Данные приводятся к формату, ожидаемому моделью (нормализация, изменение размера, токенизация).
  3. Инференс: Модель выполняет прямой проход (forward pass) — вычисляет выходные значения на основе входных данных. Все вычисления происходят локально, без обращения к сети.
  4. Постобработка: Результат (например, класс объекта, распознанный текст, сгенерированный ответ) преобразуется в удобный для пользователя формат и передаётся приложению.

Классификация

По типу выполняемых задач

По уровню интеграции

  • Системный уровень: Модели встроены непосредственно в операционную систему (например, распознавание лиц для разблокировки, оптимизация энергопотребления).
  • Прикладной уровень: Модели используются в отдельных приложениях (камера, голосовой помощник, клавиатура, фоторедактор).

Преимущества и недостатки

Преимущества

  • Конфиденциальность: Данные пользователя не покидают устройство, что критически важно для приложений, работающих с медицинской, финансовой или личной информацией. Это также упрощает соблюдение законодательства о защите данных (например, 152-ФЗ «О персональных данных» в РФ, GDPR в Европе).
  • Низкая задержка: Отсутствие сетевого обмена данными позволяет получать результат практически мгновенно (единицы миллисекунд), что необходимо для задач реального времени (автономное вождение, дополненная реальность).
  • Автономность: Работа без подключения к интернету. Это особенно важно для устройств в удалённых районах, в полёте, в метро или при ограниченном трафике.
  • Экономия трафика и ресурсов сервера: Отсутствие необходимости передавать большие объёмы данных (например, видео или аудио) снижает нагрузку на сеть и серверную инфраструктуру.

Недостатки

  • Ограниченные вычислительные ресурсы: Модели с миллиардами параметров (например, GPT-4) невозможно запустить на современном смартфоне без значительной потери качества или скорости. Требуется сжатие и квантизация.
  • Энергопотребление: Интенсивные вычисления на NPU или GPU могут быстро разряжать аккумулятор, особенно при длительном использовании.
  • Сложность обновления: Обновление модели на устройстве требует загрузки новой версии приложения или отдельного пакета, что может быть неудобно для пользователя.
  • Ограниченная память: Хранение нескольких больших моделей может занимать значительный объём встроенной памяти устройства.

Применение

Мобильные устройства

  • Камера: Распознавание сцен и объектов, портретный режим (размытие фона), улучшение ночных снимков, обнаружение улыбок.
  • Клавиатура: Автодополнение, предиктивный ввод, исправление ошибок, персонализированные словари. Пример — Gboard от Google (организация Google признана иноагентом в РФ).
  • Голосовые помощники: Локальное распознавание ключевых фраз (например, «Окей, Google», «Привет, Siri») без отправки аудио в облако.
  • Здоровье: Анализ данных с датчиков (пульс, шаги, сон) для выявления аномалий, предсказания сердечных приступов.

Умные устройства и IoT

  • Умные колонки: Локальная обработка команд для управления домом, воспроизведение музыки без задержки.
  • Системы безопасности: Распознавание лиц, обнаружение движения, идентификация звуков (разбитое стекло, дым) непосредственно на камере.
  • Промышленность: Мониторинг состояния оборудования, прогнозирование отказов на основе вибрации и температуры.

Автомобильная промышленность

  • Автономное вождение: Обработка данных с камер, лидаров и радаров в реальном времени для распознавания дорожных знаков, пешеходов, препятствий.
  • Внутрисалонные системы: Распознавание водителя (усталость, отвлечение), управление голосом, персонализация настроек.

Технологии и инструменты

Фреймворки и библиотеки

  • TensorFlow Lite: От Google (организация Google признана иноагентом в РФ). Оптимизирован для Android, iOS, Linux и микроконтроллеров. Поддерживает квантизацию, ускорение на GPU и NPU.
  • Core ML: От Apple. Эксклюзивно для iOS, macOS, watchOS, tvOS. Глубокая интеграция с аппаратным обеспечением Apple (Neural Engine).
  • ONNX Runtime: Кроссплатформенный движок от Microsoft. Поддерживает модели из различных фреймворков (PyTorch, TensorFlow).
  • ML Kit: От Google (организация Google признана иноагентом в РФ). Набор API для мобильных приложений, предоставляющий готовые решения для распознавания текста, лиц, штрих-кодов.
  • MediaPipe: От Google (организация Google признана иноагентом в РФ). Фреймворк для построения мультимодальных пайплайнов обработки видео и аудио.

Методы оптимизации моделей

  • Квантизация: Снижение точности весов модели (например, с 32-битных чисел с плавающей запятой до 8-битных целых), что уменьшает размер модели и ускоряет вычисления.
  • Прунинг (Pruning): Удаление малозначимых нейронов и связей, что уменьшает размер модели без существенной потери точности.
  • Дистилляция знаний (Knowledge Distillation): Обучение компактной модели-ученика на выходных данных большой модели-учителя.
  • Архитектурные поиски (NAS): Автоматический поиск оптимальной архитектуры нейросети для заданного устройства.

Перспективы развития

Основные направления развития машинного обучения на устройстве включают:

  • Увеличение размера моделей: Разработка более эффективных архитектур (например, Mixture of Experts) и аппаратных ускорителей позволит запускать на устройстве модели с десятками миллиардов параметров.
  • Федеративное обучение: Широкое внедрение методов, позволяющих обучать модели на данных миллионов устройств без их централизации.
  • Гибридные вычисления: Комбинирование on-device и облачного инференса: простые задачи решаются локально, сложные — отправляются в облако.
  • Интеграция с операционными системами: Встраивание on-device ML в ядро ОС для обеспечения безопасности и эффективности всех приложений.

Критика и ограничения

Несмотря на преимущества, подход имеет критику. Основные претензии связаны с:

  • Неравенством доступа: Пользователи старых или дешёвых устройств не могут использовать современные модели, что создаёт цифровой разрыв.
  • Риском «чёрного ящика»: Локальные модели могут быть менее прозрачными для аудита, чем облачные, где можно отследить каждый запрос.
  • Уязвимостью к атакам: Физический доступ к устройству позволяет злоумышленнику извлечь модель или данные, что требует дополнительных мер защиты (шифрование, Trusted Execution Environment).

Источники

  1. Howard, A. G., et al. (2017). MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications. arXiv preprint arXiv:1704.04861.
  2. TensorFlow Lite Documentation. Google AI.
  3. Core ML Framework Reference. Apple Developer Documentation.
  4. Qualcomm Snapdragon Neural Processing Engine SDK. Qualcomm Technologies.
  5. McMahan, B., et al. (2017). Communication-Efficient Learning of Deep Networks from Decentralized Data. Proceedings of the 20th International Conference on Artificial Intelligence and Statistics.
  6. Jacob, B., et al. (2018). Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition.
  7. Федеральный закон «О персональных данных» от 27.07.2006 № 152-ФЗ.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →