免費軟體資源 soft.registry
NVIDIA CUDA Toolkit 12.8 (Nsight Systems 2024.6.2) 圖示

NVIDIA CUDA Toolkit 10.1.243

v 10.1.243
macOS ↔ 也有 Windows 版 免費軟體 9.76/10 (4)
##

編輯短評

NVIDIA CUDA Toolkit 是 NVIDIA 官方推出的 GPU 平行運算開發環境,主要用來建立高效能、GPU 加速的應用程式。它內建 GPU 加速函式庫、C/C++ 編譯器、除錯與最佳化工具,以及執行期函式庫,讓開發者能直接利用 NVIDIA GPU 的運算能力。這套工具在開發者社群中評價普遍不錯,不過更新頻率不高,近期未見新版本釋出,維護狀態略顯沉寂。

這套工具適合需要在 macOS 上開發 GPU 加速應用的開發者,例如科學計算、機器學習或影像處理等領域。與同分類的其他工具相比,它綁定 NVIDIA 硬體,取捨在於若使用其他品牌 GPU 則無法發揮作用。軟體本身免費,但僅提供英文介面,且僅支援 macOS 平台(另有 Windows 版)。使用前需確認電腦配備 NVIDIA GPU,並留意系統相容性。

##

軟體介紹

NVIDIA CUDA Toolkit for Mac 提供了一個開發環境,用於建立高效能的 GPU 加速應用程式

透過適用於 macOS 的 CUDA Toolkit,您可以在 GPU 加速的嵌入式系統、桌上型工作站、企業資料中心、雲端平台以及 HPC 超級電腦上開發、最佳化及部署應用程式。



此工具套件包含 GPU 加速函式庫、除錯與最佳化工具、C/C++ 編譯器,以及用於部署應用程式的執行期函式庫。

GPU 加速的 CUDA 函式庫可在多個領域提供隨插即用的加速功能,例如線性代數、影像與視訊處理、深度學習及圖形分析。若要開發自訂演算法,您可以使用與常用語言和數值套件的既有整合,以及公開的開發 API。

您的 CUDA 應用程式可部署於所有NVIDIA GPU 系列,無論是內部部署或雲端 GPU 執行個體。利用內建功能在多 GPU 配置間分散運算,科學家與研究人員可以開發從單一 GPU 工作站擴展到包含數千顆 GPU 的雲端安裝之應用程式。

IDE 提供圖形化與命令列工具,用於除錯、識別 GPU 與 CPU 上的效能瓶頸,並提供情境感知的最佳化建議。您可以使用已熟悉的程式語言(包括 C、C++、Fortran 與 Python)來開發應用程式。

若要開始使用,請瀏覽線上入門資源、最佳化指南、範例說明,並與快速成長的開發者社群交流。立即下載適用於 macOS 的 NVIDIA CUDA Toolkit

所提供的 macOS 主機工具如下:

Nsight Systems - 支援 Pascal 及更新 GPU 的系統分析器與時間軸追蹤工具

Nsight Compute - 支援 Volta 及更新 GPU 的 CUDA 核心分析器

注意:這些工具的 macOS 主機版本(先前版本已棄用)已自 CUDA Toolkit 12.5 起移除。
請點擊以下連結查看這些工具支援的作業系統。

Visual Profiler - 支援較舊 GPU 的 CUDA 核心與系統分析器及時間軸追蹤工具

cuda-gdb - GPU 與 CPU 的 CUDA 應用程式除錯器

功能與重點
  • GPU 時間戳記:開始時間戳記
  • 方法:GPU 方法名稱。這可能是「memcpy*」(用於記憶體複製)或 GPU 核心的名稱。記憶體複製會帶有描述傳輸類型的後綴,例如「memcpyDToHasync」表示從裝置記憶體到主機記憶體的非同步傳輸
  • GPU 時間:該方法在 GPU 上的執行時間
  • CPU 時間:GPU 時間與啟動該方法的 CPU 開銷之總和。在驅動程式產生的資料層級,對於非阻塞方法,CPU 時間僅為啟動該方法的 CPU 開銷;對於阻塞方法,則為 GPU 時間與 CPU 開銷的總和。所有核心啟動預設為非阻塞。但若啟用任何分析器計數器,核心啟動則會變成阻塞。不同串流中的非同步記憶體複製請求為非阻塞
  • 串流 ID:串流的識別編號
  • 僅適用於核心方法的欄位
  • 佔用率:佔用率是每個多處理器的作用中 warp 數與最大作用中 warp 數的比率
  • 分析器計數器:請參閱分析器計數器章節以取得支援的計數器清單
  • 網格大小:沿 X、Y、Z 維度的網格區塊數,以單一欄位顯示為 [num_blocks_X num_blocks_Y num_blocks_Z]
  • 區塊大小:沿 X、Y、Z 維度的區塊執行緒數,以單一欄位顯示為 [num_threads_X num_threads_Y num_threads_Z]
  • 每個區塊的動態共享記憶體:每個區塊的動態共享記憶體大小(位元組)
  • 每個區塊的靜態共享記憶體:每個區塊的靜態共享記憶體大小(位元組)
  • 每個執行緒的暫存器數:每個執行緒的暫存器數量
  • 僅適用於記憶體複製方法的欄位
  • 記憶體傳輸大小:記憶體傳輸大小(位元組)
  • 主機記憶體傳輸類型:指定記憶體傳輸使用「可分頁」或「頁面鎖定」記憶體
優點
  • 強大的平行處理能力
  • 針對 NVIDIA GPU 最佳化
  • 強大的開發者支援
  • 廣泛的 AI 與 HPC 應用
  • 與函式庫無縫整合
缺點
  • 僅限於 NVIDIA GPU
  • 學習曲線陡峭
  • 高功耗
  • 硬體升級成本
  • 不適合所有工作負載
也可取得:下載適用於 Windows 的 NVIDIA CUDA Toolkit

下載適用於 Mac 的 NVIDIA CUDA Toolkit 最新版本 為什麼此應用程式發布在 FileHorse 上?(更多資訊
##

影片介紹

##

畫面截圖

NVIDIA CUDA Toolkit 12.8 (Nsight Systems 2024.6.2) 畫面截圖 1
##

歷史版本

完整清單 →