Описание

DeepSeek также выпустила DeepSeek-V3, модель Mixture-of-Experts (MoE) с 671B параметрами, из которых 37B активированы для каждого токена. Модель использует Multi-head Latent Attention (MLA) и архитектуру DeepSeekMoE для эффективного вывода и экономичной обучения. DeepSeek-V3 была предварительно обучена на 14,8 триллионах разнообразных и высококачественных токенов, за которыми следовали этапы контролируемой доработки и обучения с подкреплением, чтобы полностью использовать ее возможности. Оценки показывают, что DeepSeek-V3 превосходит другие модели с открытым исходным кодом и достигает производительности, сопоставимой с ведущими закрытыми моделями, при этом для полного обучения требуется всего 2,788M часов H800 GPU.

О книге

СерияИскусственный интеллект
ИздательствоАвтор
Год издания2025
Языкru
ФорматыPDF
Возрастное ограничение12

Частые вопросы

О чём книга «DeepSeek v3 – как Китай нагнул США»?
«DeepSeek v3 – как Китай нагнул США» — это информационная безопасность. DeepSeek также выпустила DeepSeek-V3, модель Mixture-of-Experts (MoE) с 671B параметрами, из которых 37B активированы для каждого токена. Модель использует Multi-head Latent Attention (MLA) и архитектуру DeepSeekMoE для эффективного вывода…
Где читать или купить «DeepSeek v3 – как Китай нагнул США»?
Книгу можно читать или купить у партнёра ЛитРес (эл. книга). Цена у партнёра — 199 ₽. Переход — по кнопке в блоке «Где читать или купить».
Что почитать похожее на «DeepSeek v3 – как Китай нагнул США»?
Близкие по теме книги: «Занимательная КиберБезопасность», «Понятная КиберГигиена», «КЛЮЧЕВЫЕ КОНЦЕПЦИИ ИНФОРМАЦИОННОЙ БЕЗОПАСНОСТИ». Полный список — в блоке «Похожие книги».