latent state // журнал

Latent State // Журнал

2026
28 ИЮЛ // CUDA · ML
Умножение матриц: от определения до кэш-линий
Одно умножение, три реализации, три порядка величины — измерено на десктопном Skylake и объяснено: кэш-линии, арифметическая интенсивность и идея тайлинга, на которой стоит каждый BLAS и каждое GPU-ядро матричного умножения.