DeepSeek: китайская нейросетевая платформа¶
DeepSeek — китайская компания и одноимённая серия больших языковых моделей (LLM) и чат-ботов, разрабатываемых компанией DeepSeek (головной офис — Ханчжоу, провинция Чжэцзян). Платформа позиционируется как открытая альтернатива коммерческим моделям США, предоставляя доступ к исходному коду и весам моделей для исследовательских и коммерческих целей.
¶История
Компания DeepSeek была основана в 2023 году как дочерняя структура китайского хедж-фонда High-Flyer, специализирующегося на количественных инвестициях. Финансирование со стороны материнской структуры позволило стартапу сфокусироваться на долгосрочных исследованиях без давления инвесторов.
В ноябре 2023 года вышла первая модель DeepSeek Coder, ориентированная на программирование. В январе 2024 года была выпущена модель DeepSeek LLM с 67 млрд параметров, которая продемонстрировала конкурентоспособные результаты по сравнению с моделями Meta (организация признана экстремистской и запрещена в РФ) LLaMA 2.
Ключевым прорывом стал выпуск DeepSeek-V2 в мае 2024 года, в котором была применена архитектура DeepSeekMoE (Mixture of Experts) с активацией лишь части параметров при обработке запроса. Это позволило значительно снизить стоимость инференса.
В декабре 2024 года вышла DeepSeek-V3 с 671 млрд параметров (37 млрд активных), обученная на кластере из 2048 графических процессоров NVIDIA H800. Обучение обошлось примерно в 5,6 млн долларов США — на порядок меньше, чем у сопоставимых западных моделей.
В январе 2025 года компания выпустила модель DeepSeek-R1, основанную на методологии reinforcement learning для развития цепочек рассуждений. Модель продемонстрировала результаты, сопоставимые с OpenAI o1, но с открытым исходным кодом. Это вызвало значительное падение акций технологических компаний США (например, NVIDIA потеряла около 600 млрд долларов рыночной капитализации за один день), поскольку инвесторы усомнились в необходимости огромных затрат на обучение моделей.
¶Технические характеристики
Основные архитектурные решения DeepSeek:
- DeepSeekMoE — разреженная архитектура, при которой каждый токен обрабатывается только несколькими «экспертами» (подсетями), что снижает вычислительные затраты.
- Multi-head Latent Attention (MLA) — механизм сжатия ключей и значений в скрытое пространство, уменьшающий объём памяти.
- Окончательная дистилляция — метод переноса знаний от больших моделей к меньшим (например, DeepSeek-R1-Distill на базе моделей Qwen и LLaMA).
Модели DeepSeek обучаются преимущественно на китайских и англоязычных текстах, что обеспечивает высокое качество работы с обоими языками. Русскоязычная поддержка реализована, однако уступает по качеству английской и китайской.
¶Доступные модели
| Модель | Параметры | Назначение |
|---|---|---|
| DeepSeek-V3 | 671 млрд (37 активных) | Универсальная текстовая модель |
| DeepSeek-R1 | 671 млрд | Усиленные рассуждения (reasoning) |
| DeepSeek-R1-Distill | 1,5–70 млрд | Компактные версии для локального запуска |
| DeepSeek-Coder | 1,3–33 млрд | Генерация кода |
| DeepSeek-VL | до 7 млрд | Мультимодальная (текст + изображения) |
Все модели распространяются под лицензией MIT, что разрешает свободное использование, модификацию и коммерческое применение.
¶Использование
Доступ к моделям DeepSeek осуществляется несколькими способами:
- Веб-интерфейс chat.deepseek.com — бесплатный чат-бот, работающий на модели DeepSeek-V3/R1.
- Мобильное приложение для iOS и Android.
- API — платный программный доступ для разработчиков (цены значительно ниже, чем у OpenAI).
- Локальный запуск — загрузка весов моделей с платформы Hugging Face для самостоятельного развёртывания.
Платформа используется для генерации текстов, написания кода, перевода, анализа данных и решения логических задач. Благодаря открытости модели DeepSeek активно применяются в академических исследованиях и в качестве основы для создания специализированных систем.
¶Ограничения и критика
Несмотря на открытость исходного кода, DeepSeek подвергается критике по нескольким направлениям:
- Цензура контента. Как китайская компания, DeepSeek соблюдает требования законодательства КНР о модерации высказываний по политическим темам (Тайвань, Синьцзян, события на площади Тяньаньмэнь). Модель может отказываться отвечать или давать официально одобренные формулировки.
- Прозрачность обучения. Компания не раскрывает полный состав обучающих данных, что затрудняет оценку возможных предвзятостей.
- Вопросы безопасности. Некоторые исследователи отмечают, что открытые веса моделей могут использоваться для создания вредоносного контента, включая дезинформацию и вредоносный код.
- Качество рассуждений. Модель R1, хотя и показывает высокие результаты в математике и логике, иногда «переусердствует» в рассуждениях, выдавая избыточно длинные цепочки умозаключений.
¶Влияние на индустрию
Появление DeepSeek изменило представления о необходимых ресурсах для разработки сильных языковых моделей. Компания продемонстрировала, что при эффективной архитектуре и оптимизации затрат можно достичь результатов мирового уровня с бюджетом, в десятки раз меньшим, чем у американских конкурентов.
Это привело к пересмотру инвестиционных стратегий в области ИИ, а также усилило дискуссию об экспортных ограничениях США на поставки чипов NVIDIA в Китай. Несмотря на запрет на продажу самых мощных чипов (H100), DeepSeek добилась успеха, используя менее производительные H800 и оптимизируя программное обеспечение.
К концу января 2025 года приложение DeepSeek стало самым скачиваемым бесплатным приложением в американском App Store, обойдя ChatGPT. Это свидетельствует о высоком интересе пользователей к бесплатным открытым альтернативам.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →

