回顾计算机硬件的发展历程, 鲜少有组件宛如图形处理器GPU这般历经那般极富戏剧性的角色转变。二十多年之前, 彼时它还仅仅是专门用于把像素点渲染至屏幕上去的特别芯片。而时至今日, 它已然摇身蜕变为推动人工智能、科学计算以及数字孪生等前沿领域实现发展的关键算力源头。从渲染管线到并行计算GPU架构设计原本的目的, 便是去处理好多大量并行的图形计算任务。跟中央处理器也就是CPU有着少数几个高性能核心不一样, GPU含有数千个相对而言较为简单的计算核心。就拿英伟达A100加速卡来说, 它具备6912个CUDA核心, 而同一时期旗舰CPU的核心数量一般不会超过64个。这样的设计致使GPU在开展大规模矩阵运算的时候有着天然的优势, 而这正是图形渲染以及神经网络训练共同的底层数学操作。于2006年的时候, 英伟达发布了CUDA即统一计算设备架构编程平台, 首次使得开发者能够借助GPU开展通用计算。这样一件具备里程碑意义的事件, 把GPU从专用图形硬件给转变成为可编程的并行计算平台, 此后, AMD的ROCm、苹果的Metal以及开源的 等异构计算框架先后出现, 一同构建起了GPU通用计算的软件生态。算力指标的量化标准对于GPU算力的衡量而言, 常常会涉及到的是, 三个核心指标, 其一为在不同等级方面, 被划分成单精度FP32双精度FP64以及半精度FP16等的浮点运算能力FLOPS, 其二是显存带宽指标, 其三是能效比指标。拿当下主流产品当作例子来讲, 英伟达H100的FP32算力是可以达到67万亿次每秒的, 其FP16张量算力能够达到989. , AMD 的FP32算力是81. , 在FP16算力它为261.。数据在显存与计算核心之间的传输速率由显存带宽决定, H100配备80GB HBM3显存, 其带宽达3.35 TB/s, 配备192GB HBM3显存, 带宽为5.2 TB/s。每每瓦特功耗所产生的算力由能效比衡量, H100的FP16算力能效比约为2.9 /W, 在数据中心大规模部署时该指标尤为关键。应用场景的多元拓展在人工智能这个特定领域当中, GPU已然成为了用于训练大语言模型以及深度学习网络的标准硬件。的GPT - 4据推测利用了大约25000块A100来开展训练, 其训练周期长达90至100天。在科学计算这个范畴里, GPU加速的分子动力学模拟、气候预测还有基因组分析等应用已经极大程度地缩短了计算所需的时间。在2020年的时候, 美国橡树岭国家实验室的超级计算机借助GPU加速, 把COVID - 19病毒蛋白结构模拟的时间从几个月缩短到了数天。游戏与内容创作领域里, GPU的光线追踪技术将电影级画面予以实时渲染出。2023年发布的《赛博朋克2077》, 开启路径追踪模式后, 单帧渲染所需光线采样超500次, 而这唯有借助GPU专用光线追踪核心方可实时运行起来。除此之外呢, GPU在视频编解码以及区块链挖矿虽说2022年后该需求大幅回落了, 还有自动驾驶汽车的感知系统等领域都有着广泛应用。市场规模与产业格局2023年, 全球GPU市场的规模为653亿美元, 预计到2028年, 该市场规模会增长至2742亿美元, 其年均复合增长率是33.2%。这一增长主要是由AI训练和推理需求所驱动的。2023年, 数据中心GPU的收入首度超过游戏GPU, 在总收入里所占比例是58.4%。就竞争格局而言, 英伟达于独立 GPU 市场占据了大约 80% 的份额, AMD 所占份额约为 17%, 英特尔借由 Arc 系列在 2022 年再度进入独立 GPU 市场, 当前份额约是 3%。于 AI 加速卡细分市场里边, 英伟达的 A100 和 H100 系列总计占据了超过 90% 的份额。与此同时, 谷歌的 TPU、华为的昇腾以及寒武纪的思元系列等专用 AI 芯片在特定场景当中也构成了竞争。技术瓶颈与未来方向现今GPU算力前进出现: 功耗墙、存储墙以及互连带宽, 这三大阻碍。H100的最高功耗是达700瓦, 一个有着1000块H100的集群, 一年的耗电量大概是613万度, 这等同于大约2500个平常家庭一年的用电数量。存储墙所说的是显存容量跟计算能力增长不相匹配的状况, 在过去的五年里GPU算力增长大概16倍, 然而显存容量仅仅增长大概4倍。着眼于未来, 3D堆叠芯片技术有希望将计算核心跟存储单元进行垂直集成, 从而缩短数据通路的物理距离, 英伟达的架构运用台积电4NP定制工艺, 把晶体管密度提升到2080亿个, 另外, 光互连技术、即小芯片设计以及新型存储器件像MRAM也处于研发进程中,在软件层级, CUDA生态的持续完善还有开源框架比如、的深度优化, 会持续释放GPU的潜在算力。GPU算力的发展不是简单的技术更新换代, 它正改变着计算产业的底层逻辑。并行计算成为通用模式, 算力成为类似电力的基础资源时, GPU从图形加速器演变成驱动数字世界运行的核心引擎。这场计算模式的转变, 才刚开始。