6月硬件盘点:AI加速卡与边缘设备入门
过去一个月,AI硬件领域发布了三款有代表性的产品:英伟达H200、AMD MI300X和英特尔酷睿Ultra。它们分别对应云端训练、云端推理和终端推理三个场景。对于刚接触AI硬件的读者,理解这三者的区别,比记住具体参数更重要。
先看云端训练。英伟达H200在6月正式出货,它把H100的80GB HBM3显存升级到141GB HBM3e,显存带宽从3.35TB/s提升到4.8TB/s。这个数字意味着什么?训练一个千亿参数模型,H100需要约2000张卡跑一个月,H200可以把这个时间压缩到一周以内。代价是单卡功耗700W,整机柜需要专用液冷。目前AWS和谷歌云已经上线实例,按小时计费约每卡32美元。
AMD的MI300X走的是另一条路。它把显存做到192GB,比H200还多51GB,但带宽只有5.3TB/s,略高一点。关键差异在价格:MI300X单卡约1.5万美元,H200约3万美元。微软Azure和Meta已经批量采购,用于推理任务。推理对显存容量敏感,对带宽要求相对低,MI300X的定位很准。不过它的软件栈ROCm相比英伟达CUDA仍有差距,部分算子需要手动调优。
再看终端。英特尔酷睿Ultra处理器从去年底开始铺货,今年6月已经出现在主流轻薄本上。它内置NPU,算力约10TOPS,功耗15W。这个算力跑不了大模型训练,但可以本地运行70亿参数以下的模型,比如Llama 3 8B量化版。实际体验中,文本生成速度约每秒15个token,够用但不算快。好处是数据不出本地,适合处理敏感文档。
边缘设备里还有一个值得提的:树莓派AI Kit。它用M.2接口接了一个Hailo-8L加速模块,算力13TOPS,功耗仅2.5W,整套价格70美元。搭配树莓派5,可以跑目标检测、姿态识别这类视觉模型。有个具体例子:用YOLOv8n模型检测画面中的行人,帧率能到30fps,延迟低于50毫秒。这比用CPU跑快20倍以上。
把这几款产品放在一起看,AI硬件的分层已经清晰:云端训练用H200,云端推理用MI300X,终端轻量推理用酷睿Ultra,边缘视觉用树莓派AI Kit。每一层都有明确的算力、功耗和价格区间。入门读者不需要记住所有参数,记住这个分层逻辑就够了。
选购建议上,如果你只是想在本地跑一个小模型做实验,不需要买加速卡。一台带酷睿Ultra的笔记本,或者树莓派5加AI Kit,总花费不超过8000元,就能覆盖大部分入门场景。云端训练按需租用即可,没必要自建。硬件更新很快,按需选择比追新更实际。