◆ CUDA Compute // 1 запись
2026
Умножение матриц: от определения до кэш-линий
Одно умножение, три реализации, три порядка величины — измерено на десктопном Skylake и объяснено: кэш-линии, арифметическая интенсивность и идея тайлинга, на которой стоит каждый BLAS и каждое GPU-ядро матричного умножения.