RISC-V Tensor扩展指令集正式开源,赋能AI时代开放计算生态
RACE委员会、北京开源芯片研究院携手北京算能科技有限公司,正式对外开源发布面向RISC-V + AI生态体系的Tensor扩展指令集。该扩展在RISC-V基础指令集架构之上,面向人工智能领域的高强度计算需求引入Tensor级计算语义与统一张量编程模型,全面覆盖卷积运算、矩阵乘法、数据搬运、多精度计算及量化等核心AI工作负载,为AI编译器研发以及TPU架构的设计与落地实现提供开放、统一、可灵活扩展的基础能力。
项目背景
当前,人工智能技术正经历飞速发展,从大规模模型训练到各类智能推理应用,计算负载持续向大规模并行的Tensor计算模式倾斜。相比传统以通用处理器为核心的计算范式,现代AI工作负载更加依赖TPU类专用加速器所提供的高吞吐计算能力,同时也对多精度计算融合、数据布局转换以及计算与存储的高效协同调度等关键能力提出了更为严苛的要求。
RISC-V作为开放指令集架构,为产业界的协同创新奠定了坚实基础。如何在开放架构体系下构建面向AI计算的新型软硬件接口,已成为推动RISC-V AI生态向前发展的关键议题。Tensor扩展指令集通过在基础ISA之上引入面向AI计算的高级抽象层,使算法、编译器与硬件实现之间能够建立更为统一的表达范式,为打造开放的AI加速计算生态提供全新的指令集架构底座。
指令集设计理念
Tensor扩展指令集围绕AI计算过程中的访存需求,共规划了126条扩展指令,从Tensor数据组织、计算语义以及数据搬运机制等多个维度展开系统性设计。该扩展引入了面向Tensor计算的寄存器模型,借助Tensor配置寄存器对数据布局、形状、数据类型及存储位置进行精确描述,使软件能够以更直接、更自然的方式刻画AI计算任务。与此同时,扩展还围绕深度学习中的典型计算模式,构建了覆盖卷积、矩阵乘、Pooling、逐元素计算、精度转换、量化计算以及数据重排等操作的Tensor指令体系,为AI算法向硬件执行的映射过程提供统一接口。
与通用处理器依赖基础指令组合来完成复杂AI计算的做法不同,Tensor扩展更加聚焦AI计算过程中的高层语义表达。通过将典型AI计算模式映射为可直接执行的指令,可有效降低软件层面的算子拆解复杂度,拓宽编译器优化空间,并为不同实现形态的TPU类AI加速器提供灵活的架构实现路径。
在AI计算过程中,数据搬运效率与计算能力同等关键地决定着系统整体性能。Tensor扩展设计了配套完善的数据搬运机制,通过DMA相关指令支持Tensor数据的加载、存储、复制、转置以及Gather/Scatter等操作,实现计算单元与存储系统之间的数据流协同优化,为高吞吐AI计算奠定坚实基础。
指令集验证与展望
在应用落地层面,Tensor扩展指令集已被企业处理器平台所采纳,并实现了完整的指令支持。基于该扩展打造的处理器已成功完成流片,在硬件层面充分验证了Tensor指令体系在AI加速架构中的可行性,为后续TPU类AI加速器设计、编译工具链适配以及软硬件生态建设提供了坚实的工程基础。
此次Tensor扩展指令集的开源发布,是RISC-V AI生态建设进程中的重要探索。通过开放指令规范,可进一步促进芯片设计、编译工具链、系统软件以及高校科研之间的协同创新,推动AI指令集、工具链和处理器实现之间形成更加开放的合作模式,为面向大模型、边缘智能和高性能AI计算的开放架构发展提供基础支撑。
展望未来,RISC-V Tensor扩展将持续面向人工智能计算需求不断演进,推动从指令集规范、编译工具链到TPU类AI加速器实现的开放协同,与产业界、学术界携手共建开放、可持续发展的AI计算生态。
开启你的RISC-V AI之旅,期待与你共创辉煌!
相关指令集文档可通过以下两种方式查看与下载,欢迎大家提供修改建议进行讨论。
方式一:复制并在浏览器中打开官方网址:riscv-ai.org.cn/resource/34
方式二:点击左下角「阅读原文」,即可一键直达社区!