为了解决这些问题,Nvidia 开发了自定义融合内核,将分组 GEMM、激活函数(SwiGLU、GeGLU、sReLU)和量化等操作集成到单个 CUDA 内核中。
Ankura China Advisors 董事总经理 Alfredo Montufar-Helu 表示,北京现在对待人工智能的方式与处理半导体限制的方式相同。