DeepSeek V4.1-Flash: новая архитектура, 552 млрд параметров и агентные тесты

DeepSeek вывела V4.1-Flash — младшую модель новой архитектурной линейки компании. Это MoE-модель на 552 млрд параметров с нативной поддержкой изображений, контекстом до 1 млн токенов и отдельными режимами reasoning.
Наиболее интересная часть релиза — архитектурные изменения. DeepSeek перешла к асимметричной схеме Causal Encoder–Decoder: при prefill активируется около 8 млрд параметров на токен, а при decode — 16 млрд. То есть вычислительный бюджет для обработки входа и генерации намеренно сделали разным.
В модели также используется новый Engram-модуль на 196 млрд параметров для работы с N-граммами. В сочетании с MoE это позволяет разделить часть знаний и вычислений между параметрами, которые не нужно прогонять через основную сеть на каждом токене.
Отдельно DeepSeek переработала работу с KV-cache. Для длинного контекста это одна из ключевых оптимизаций V4.1-Flash: компания заявляет заметное снижение memory footprint по сравнению с предыдущим поколением. В документации модель также использует QAT для KV-cache и FP4-квантизацию, что дополнительно снижает требования к памяти при инференсе.
Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.