WebGPU终于能用了——浏览器里跑AI模型到底有多快

王尘宇 科技百科 1

WebGPU这个标准从2017年开始讨论,2023年Chrome正式支持,但真正能用到生产环境是2025年底以后的事。我上个月在MacBook Air M3上实测了一下,说说实际情况。

它跟WebGL有什么区别

WebGL本质上是OpenGL ES的浏览器封装,设计年代是2009年。WebGPU是全新的,直接面向Vulkan/Metal/DX12这些现代图形API。说人话就是:WebGL能做3D渲染但算力受限,WebGPU可以直接调用GPU做通用计算,不用拐弯抹角用shader模拟。

最大的变化是计算着色器(compute shader)可以单独用,不绑定渲染管线。这对跑AI模型太关键了——以前你得假装在做渲染,把数据塞进纹理才能让GPU干活。

实际跑模型的速度

我测了三个场景:

1. Stable Diffusion 1.5 生成512x512图片:WebGPU版大约3.2秒,WebGL版(如果有的话)至少15秒+。跟本地原生SD比,慢了大概30%,但这个差距在缩小。

2. Whisper tiny 语音识别:一段30秒的音频,WebGPU转录耗时1.8秒。完全够用,比API调用快(省掉了网络延迟)。

3. Llama 3.2 1B 文本生成:这个有点惨,每秒大概8-12个token,勉强可用但别期望太多。模型小是一方面,浏览器沙箱的内存限制也是瓶颈。

真正的坑

兼容性还是最大的问题。Firefox 2025年底才勉强跟上,Safari虽然很早支持但Bug层出不穷。我们测试时发现同一个shader在Chrome上跑得好好的,Safari直接白屏,调了两天才发现是Safari对某些buffer binding的限制比标准更严。

另外,浏览器标签页切到后台后GPU会被限速,这是浏览器的省电机制,没办法绕过。如果你的应用需要持续后台计算,WebGPU不太适合。

什么时候该用

如果你的场景是:用户上传一张图做实时处理(去背景、滤镜)、浏览器里的轻量AI推理(人脸检测、OCR)、或者数据可视化需要GPU加速的图表渲染,现在就可以上。模型文件可以用IndexedDB缓存,第二次打开秒加载。

如果你要做大模型推理、实时视频处理,再等等。WASM+WebGPU的组合在2026年底可能会有突破,但目前还不成熟。

一句话:不是替代品,是增量场景。把一些原来必须上服务端的计算挪到浏览器里,省服务器成本、降延迟,这才是WebGPU真正的价值。

标签: WebGPU 浏览器GPU AI推理 前端技术 WebGL

发布评论 0条评论)

  • Refresh code

还木有评论哦,快来抢沙发吧~