龙芯加速计算平台首发软件版本,兼容CUDA与OpenCL 3.0
龙芯中科推出自研通用GPU加速计算平台首个软件版本,基于2K3000和9A1000芯片的LG200 GPU核心,覆盖驱动、编译器、算子库与推理引擎,支持OpenCL 3.0及CUDA编程模型,可用于AI模型推理。
龙芯中科在通用GPU软件生态上迈出关键一步。9月22日,该公司宣布推出龙芯加速计算平台(Loongson Accelerated Computing Platform)的首个软件版本,为旗下自研通用GPU提供从底层驱动到AI推理的完整软件栈支持。该平台基于龙芯2K3000与9A1000芯片集成的LG200系列通用GPU核心构建,标志着龙芯在算力芯片配套软件层面开始形成体系化能力。
与此前已有的OpenGL、Vulkan图形软件栈不同,新平台将覆盖范围扩展至算力芯片驱动、编译器、运行时环境、算子库、推理引擎、调试工具及性能分析工具等组件。编程模型方面,平台同时支持OpenCL 3.0和CUDA两类接口,并集成BLAS、DNN等高性能算子库,可直接用于AI模型推理任务。这一兼容策略意味着开发者能够以较低的迁移成本接入龙芯GPU算力。
在运行时层面,平台提供资源调度管理、内存管理、任务队列调度和事件同步等功能;底层驱动则对不同硬件计算资源进行统一抽象和管理,以支撑多进程、多任务并发执行。平台集成的算力编译器针对龙芯通用GPU的指令集架构与硬件特性做了专门优化,并通过API层面的兼容进一步降低开发和适配门槛。调试与分析工具支持断点设置、寄存器访问以及张量单元等硬件部件状态检查。
该平台面向龙芯全系列算力芯片,覆盖从系统选型、算力调用、模型优化到应用部署的完整开发流程。对于关注国产算力生态的AI从业者而言,龙芯此次将软件栈与硬件核心同步推进,为其通用GPU在推理场景中的实际落地提供了基础工具链支撑。