内存墙之痛:为什么AI加速不能只靠堆计算单元?
本文介绍了为什么AI加速不能只靠堆计算单元。 很多人一说起AI加速,第一反应就是堆算力、堆更多浮点计算单元。 错了, 现在的瓶颈根本不是计算本身,是数据搬运、通信和不规则算子,峰值算力再高也没用。 举个最直观的例子,大语言模型推理的时候,每个新生成的token都要读写一遍已经存起来的KV缓存,这玩意儿根本不怎么缺计算,缺的是内存带宽——你带宽不够,就算计算单元堆得再多,也得等着数据慢悠悠从内存运
关于「AI加速器」的技术文章、设计资料与工程师讨论,持续更新。
本文介绍了为什么AI加速不能只靠堆计算单元。 很多人一说起AI加速,第一反应就是堆算力、堆更多浮点计算单元。 错了, 现在的瓶颈根本不是计算本身,是数据搬运、通信和不规则算子,峰值算力再高也没用。 举个最直观的例子,大语言模型推理的时候,每个新生成的token都要读写一遍已经存起来的KV缓存,这玩意儿根本不怎么缺计算,缺的是内存带宽——你带宽不够,就算计算单元堆得再多,也得等着数据慢悠悠从内存运
当AI加速器陷入“算力过剩、数据饥渴”的怪圈,决定性能上限的早已不是计算核心的数量,而是内存带宽与互联架构。本文带你跳出“堆算力”的误区,重新审视AI硬件的真正战场。 现在跑大模型,大家都在喊算力不够,要堆更多核心。 但现在AI加速器的性能瓶颈,早就不是计算单元本身,而是内存和互联架构。 AI加速器到底是怎么进化到今天的 AI硬件的发展路线其实非常清晰,就是从通用到专用一步步走过来的。 最早大家都