Z.ai выпустила GLM-5.3-Flash: 320B параметров, 1 млн токенов контекста и нативная мультимодальность
Z.ai выпустила GLM-5.3-Flash — первую нативно мультимодальную модель семейства GLM-5. Она сочетает 320 млрд параметров, из которых на каждом токене активируется около 18 млрд, и гибридную архитектуру, рассчитанную на снижение стоимости инференса при работе с длинным контекстом. Главная архитектурная особенность — комбинация sparse attention и linear attention. Решение снижает объем вычислений attention, по сравнению с GLM-5.3, в 3,01 раза, а размер KV-cache — в 4,44 раза. Для длинного контекста
