Открыть сервис

DeepSeek: китайская нейросетевая платформа

DeepSeek — китайская компания и одноимённая серия больших языковых моделей (LLM) и чат-ботов, разрабатываемых компанией DeepSeek (головной офис — Ханчжоу, провинция Чжэцзян). Платформа позиционируется как открытая альтернатива коммерческим моделям США, предоставляя доступ к исходному коду и весам моделей для исследовательских и коммерческих целей.

История

Компания DeepSeek была основана в 2023 году как дочерняя структура китайского хедж-фонда High-Flyer, специализирующегося на количественных инвестициях. Финансирование со стороны материнской структуры позволило стартапу сфокусироваться на долгосрочных исследованиях без давления инвесторов.

В ноябре 2023 года вышла первая модель DeepSeek Coder, ориентированная на программирование. В январе 2024 года была выпущена модель DeepSeek LLM с 67 млрд параметров, которая продемонстрировала конкурентоспособные результаты по сравнению с моделями Meta (организация признана экстремистской и запрещена в РФ) LLaMA 2.

Ключевым прорывом стал выпуск DeepSeek-V2 в мае 2024 года, в котором была применена архитектура DeepSeekMoE (Mixture of Experts) с активацией лишь части параметров при обработке запроса. Это позволило значительно снизить стоимость инференса.

В декабре 2024 года вышла DeepSeek-V3 с 671 млрд параметров (37 млрд активных), обученная на кластере из 2048 графических процессоров NVIDIA H800. Обучение обошлось примерно в 5,6 млн долларов США — на порядок меньше, чем у сопоставимых западных моделей.

В январе 2025 года компания выпустила модель DeepSeek-R1, основанную на методологии reinforcement learning для развития цепочек рассуждений. Модель продемонстрировала результаты, сопоставимые с OpenAI o1, но с открытым исходным кодом. Это вызвало значительное падение акций технологических компаний США (например, NVIDIA потеряла около 600 млрд долларов рыночной капитализации за один день), поскольку инвесторы усомнились в необходимости огромных затрат на обучение моделей.

Технические характеристики

Основные архитектурные решения DeepSeek:

  • DeepSeekMoE — разреженная архитектура, при которой каждый токен обрабатывается только несколькими «экспертами» (подсетями), что снижает вычислительные затраты.
  • Multi-head Latent Attention (MLA) — механизм сжатия ключей и значений в скрытое пространство, уменьшающий объём памяти.
  • Окончательная дистилляция — метод переноса знаний от больших моделей к меньшим (например, DeepSeek-R1-Distill на базе моделей Qwen и LLaMA).

Модели DeepSeek обучаются преимущественно на китайских и англоязычных текстах, что обеспечивает высокое качество работы с обоими языками. Русскоязычная поддержка реализована, однако уступает по качеству английской и китайской.

Доступные модели

МодельПараметрыНазначение
DeepSeek-V3671 млрд (37 активных)Универсальная текстовая модель
DeepSeek-R1671 млрдУсиленные рассуждения (reasoning)
DeepSeek-R1-Distill1,5–70 млрдКомпактные версии для локального запуска
DeepSeek-Coder1,3–33 млрдГенерация кода
DeepSeek-VLдо 7 млрдМультимодальная (текст + изображения)

Все модели распространяются под лицензией MIT, что разрешает свободное использование, модификацию и коммерческое применение.

Использование

Доступ к моделям DeepSeek осуществляется несколькими способами:

  1. Веб-интерфейс chat.deepseek.com — бесплатный чат-бот, работающий на модели DeepSeek-V3/R1.
  2. Мобильное приложение для iOS и Android.
  3. API — платный программный доступ для разработчиков (цены значительно ниже, чем у OpenAI).
  4. Локальный запуск — загрузка весов моделей с платформы Hugging Face для самостоятельного развёртывания.

Платформа используется для генерации текстов, написания кода, перевода, анализа данных и решения логических задач. Благодаря открытости модели DeepSeek активно применяются в академических исследованиях и в качестве основы для создания специализированных систем.

Ограничения и критика

Несмотря на открытость исходного кода, DeepSeek подвергается критике по нескольким направлениям:

  • Цензура контента. Как китайская компания, DeepSeek соблюдает требования законодательства КНР о модерации высказываний по политическим темам (Тайвань, Синьцзян, события на площади Тяньаньмэнь). Модель может отказываться отвечать или давать официально одобренные формулировки.
  • Прозрачность обучения. Компания не раскрывает полный состав обучающих данных, что затрудняет оценку возможных предвзятостей.
  • Вопросы безопасности. Некоторые исследователи отмечают, что открытые веса моделей могут использоваться для создания вредоносного контента, включая дезинформацию и вредоносный код.
  • Качество рассуждений. Модель R1, хотя и показывает высокие результаты в математике и логике, иногда «переусердствует» в рассуждениях, выдавая избыточно длинные цепочки умозаключений.

Влияние на индустрию

Появление DeepSeek изменило представления о необходимых ресурсах для разработки сильных языковых моделей. Компания продемонстрировала, что при эффективной архитектуре и оптимизации затрат можно достичь результатов мирового уровня с бюджетом, в десятки раз меньшим, чем у американских конкурентов.

Это привело к пересмотру инвестиционных стратегий в области ИИ, а также усилило дискуссию об экспортных ограничениях США на поставки чипов NVIDIA в Китай. Несмотря на запрет на продажу самых мощных чипов (H100), DeepSeek добилась успеха, используя менее производительные H800 и оптимизируя программное обеспечение.

К концу января 2025 года приложение DeepSeek стало самым скачиваемым бесплатным приложением в американском App Store, обойдя ChatGPT. Это свидетельствует о высоком интересе пользователей к бесплатным открытым альтернативам.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →