作者:轩辕志瑜
链接:https://bbs.eetop.cn/thread-1006214-1-1.html
1. 架构概述
1.1 设计定位
GPU 子系统是一个面向商用级图形渲染与并行计算的 GPU RTL 实现,采用 Chisel3 硬件描述语言开发,参考 NVIDIA Ampere / Ada Lovelace 架构、AMD RDNA 3 架构、Intel Xe HPG 架构设计理念。
核心特征 :
96 个硬件模块,9 大功能类别
SIMT 执行模型 (32-lane Warp)
11 阶段固定功能图形管线 + 2 个可编程着色器阶段
8 个 ISA 扩展 (GBase/GFP/GTensor/GRT/GAI/GVideo/GCompute/GGeometry)
多核可扩展架构 (1..16 核)
三路显示输出 (HDMI 2.1 + DP 2.1 + VGA)
8K × 8K 最大分辨率 (7680×4320@60Hz)
4 级存储层次 (RegFile → SharedMem → L1 → L2)
8×8 NoC Mesh 互连
Tensor Core (16×16 矩阵乘累加)
RT Core (光线追踪,64 光线并行)
完整可靠性 (ECC + DFT + DVFS + JTAG Debug)
1.2 总体评级
![]()
12. 性能指标
12.1 图形管线性能
![]()
12.2 计算性能
![]()
12.3 实测性能 (SDL3 + Verilator 仿真)
- 20 Demo 全部通过 (100%)
- 双核 IPC: 3.6049
- 核平衡度: 0.8961
- VGA 吞吐: 0.46 pixels/cycle
- 8K 分辨率: 全部通过
- 多接口输出: 2 HDMI + 2 DP + 2 VGA 全部通过
4. 图形管线架构
4.1 管线阶段实现 11 阶段固定功能 + 2 阶段可编程图形管线:
![]()
4.2 API 兼容性硬件管线功能兼容(非软件 API 实现):
Vulkan 1.3 Pipeline Specification
OpenGL 4.6 Pipeline
DirectX 12 Pipeline
支持的图形特性:
8 MRT (Multiple Render Targets)
MSAA 1×/2×/4×/8×/16×
8 深度比较函数 + Early-Z
10 混合因子 + 5 混合方程
模板测试 (8 ops)
NDC [-1,1] (OpenGL) / [0,1] (DirectX) Z 范围
最大视口 8K × 8K (7680×4320)
4. GpuTop 黑盒验证 (15/15 PASS)4.1 DUT 信息
![]()
4.2 测试用例
![]()
4.3 仿真结果
=== GpuTop Black-Box Test: 15 PASS, 0 FAIL ===
=== Total cycles: 502 ===
=== ALL PASS ===
$finish called at time : 5196 ns
GPU 子系统框架图与工程表 在 楼
代码下载(需要到论坛里下载)
附件:GPU.zip(约 1020.96 KB)
欢迎大家访问作者帖子
觉得有帮助可以关注并点赞支持作者
https://bbs.eetop.cn/thread-1006214-1-1.html
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.