国产伦久视频免费观看青草青在线,无论你在哪,都能随时体验高速与便捷的服务

k1体育麻将胡了

搜索 猫眼影戏 融媒体矩阵
  • 山东手机报

  • 猫眼影戏

  • 公共网官方微信

  • 公共网官方微博

  • 抖音

  • 人民号

  • 天下党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

刚刚,英伟达CUDA迎来史上最大更新!

2025-12-09 20:44:05
泉源:

猫眼影戏

作者:

约瑟夫·蒂姆齐

手机审查

  猫眼影戏记者 周长玉 报道Q8X2R7L1T4J5M9B6W3

几个小时前,NVIDIA CUDA Toolkit 13.1 正式宣布,英伟达官方体现:「这是 20 年来最大的一次更新。」

英伟达社媒

这个自 2006 年 CUDA 平台降生以来规模最大、最周全的更新包括:

NVIDIA CUDA Tile 的宣布,这是英伟达基于 tile 的编程模子,可用于笼统化专用硬件,包括张量焦点。

Runtime API exposure of green contexts(是指把所谓的 Green Context「指轻量级的、可并发调理的上下文或执行情形」袒露给外部挪用者使用。)

NVIDIA cuBLAS 中的双精度和单精度仿真。

一本完全重写的 CUDA 编程指南 ,专为 CUDA 新手和高级程序员设计。

下面我们就来详细看看。

CUDA Tile

CUDA Tile 是 NVIDIA CUDA Toolkit 13.1 最焦点的更新。它是一种基于 tile 的编程模子,能够以更高的条理编写算法,并笼统化专用硬件(例如张量焦点)的细节。

英伟达社媒

解读 CUDA Tile 的焦点看法

英伟达博客诠释说:CUDA Tile 可闪开发者在高于 SIMT(单指令多线程)的层级编写 GPU 核函数。

在现在的 SIMT 编程中,开发者通常通过划分数据并界说每个线程的执行路径来指定核函数。

而借助 CUDA Tile,开发者可以提升代码的笼统层级,直接指定被称为「Tile」的数据块。只需指定要在这些 Tile 上执行的数学运算,编译器和运行时情形会自动决议将事情负载分发到各个线程的最佳方法。

这种 Tile 模子屏障了挪用 Tensor Core 等专用硬件的底层细节,并且 Tile 代码将能够兼容未来的 GPU 架构。

CUDA 13.1 包括两个用于 Tile 编程的组件:

CUDA Tile IR:一种用于 NVIDIA GPU 编程的全新虚拟指令集架构(ISA)。

cuTile Python:一种新的领域特定语言(DSL),用于在 Python 中编写基于数组和 Tile 的核函数。

底层细节

编译的 Tile 路径可以融入完整的软件栈,与 SIMT 路径对应。

这是该软件的首个版本,其包括以下注重事项:

CUDA Tile 仅支持 NVIDIA Blackwell(盘算能力 10.x 和 12.x)系列产品。未来的 CUDA 版本将扩展对更多架构的支持。

现在的开发重点聚焦于 AI 算法的 Tile 编程。英伟达体现在未来的 CUDA 版本中将一连增添更多特征、功效并提升性能。

英伟达妄想在即将宣布的 CUDA 版本中引入 C++ 实现。

为什么要为 GPU 引入 Tile 编程?

CUDA 向开发者提供了单指令多线程(SIMT)硬件和编程模子。这种模式要求(同时也允许)开发者以最大的无邪性和针对性,对代码的执行方法举行细粒度控制。然而,编写高性能代码往往需要支付重大的心力,尤其是在需要适配多种 GPU 架构的情形下。

只管已有许多库(如 NVIDIA CUDA-X 和 NVIDIA CUTLASS)旨在资助开发者挖掘性能,但CUDA Tile 引入了一种比 SIMT 层级更高的新型 GPU 编程方法。

随着盘算事情负载的演进,特殊是在 AI 领域,张量已成为一种基础数据类型。NVIDIA 开发了专门用于处置惩罚张量的硬件,例如 NVIDIA Tensor Core(TC)和 NVIDIA Tensor Memory Accelerator(TMA),它们现已成为每个新 GPU 架构中不可或缺的组成部分。

硬件越重大,就越需要软件来资助驾驭这些能力。CUDA Tile 对 Tensor Core 及其编程模子举行了笼统,使得使用 CUDA Tile 编写的代码能够兼容目今及未来的 Tensor Core 架构。

基于 Tile 的编程方法允许开发者通过指定命据块(即 Tile),然后界说在这些 Tile 上执行的盘算来编写算法?⒄呶扌柙谥鹪氐牟忝嫔仙瓒ㄋ惴ǖ闹葱邢附冢罕嘁肫骱驮诵惺苯χ贸头U庑┦虑。

下图展示了随 CUDA Tile 推出的 Tile 模子与 CUDA SIMT 模子之间的看法差别。

Tile 模子与 CUDA SIMT 模子之间的看法差别

Tile 模子(左)将数据划分为多个块,编译器将其映射到线程。单指令多线程(SIMT)模子(右)将数据同时映射到块和线程

这种编程范式在 Python 等语言中很常见,在这些语言中,像 NumPy 这样的库可以闪开发者指定矩阵等数据类型,然后用简朴的代码指定并执行批量操作。

CUDA 软件更新

以下是本次 CUDA 版本更新中包括的其他主要软件刷新:

运行时对 Green Context(绿色上下文)的支持

CUDA 中的 Green Context 是一种轻量级的上下文形式,可作为古板 CUDA 上下文的替换计划,为开发者提供更细粒度的 GPU 空间划分与资源分派能力。

自 CUDA 12.4 起,它们已在驱动 API 中提供;而从本版本最先,Green Context 也正式在运行时 API 中开放使用。

Green Context 使用户能够界说和治理 GPU 资源的自力分区,主要是 Streaming Multiprocessors(SM)。你可以将特定命目的 SM 分派给某个特定的 Green Context ,然后在该 context 所拥有的资源规模内启动 CUDA kernel 并治理只在此 context 内运行的 stream。

一个典范的应用场景是:你的程序中有部分代码对延迟极为敏感,并且需要优先于其他所有 GPU 事情执行。通过为这段代码单独建设一个 Green Context 并分派 SM 资源,而将剩余的 SM 分派给另一个 Green Context 处置惩罚其他使命,你就能确保始终有可用的 SM 供高优先级盘算使用。

CUDA 13.1 还引入了越发可定制的 split () API?⒄呖梢酝ü庖唤涌诠菇ù饲靶枰啻 API 挪用才华完成的 SM 分区,并且可以设置事情行列,从而镌汰差别 Green Context 之间提交使命时爆发的伪依赖(false dependencies)。

有关这些功效及 Green Context 的更多信息,请拜见 CUDA Programming Guide。

CUDA 编程指南地点:https://docs.nvidia.com/cuda/cuda-programming-guide/04-special-topics/green-contexts.html

CUDA 多历程效劳(MPS)更新

CUDA 13.1 为多历程效劳带来了多项新特征和功效。有关这些新功效的完整信息,请参阅 MPS 文档。以下是部分亮点内容:

内存局部性优化分区

内存局部性优化分区(Memory locality optimization partition,MLOPart)是 NVIDIA Blackwell 系列(盘算能力 10.0 和 10.3,为架构版本号)及更新 GPU 上提供的一项特征。

该功效允许用户建设专门优化内存局部性的 CUDA 装备。MLOPart 装备基于统一块物理 GPU 派生而来,但泛起为多个自力装备,每个装备拥有更少的盘算资源和更小的可用内存。

在盘算能力 10.0 和 10.3 的 GPU 上,每块 GPU 都包括两个分区。

当在 GPU 上启用 MLOPart 时,每个分区都会作为一个自力的 CUDA 装备泛起,并具有其对应的盘算与内存资源。

现在,MLOPart 仅支持 NVIDIA B200 与 NVIDIA B300 系列产品。未来的 CUDA 宣布版本将加入对 NVIDIA GB200 与 NVIDIA GB300 系列的支持。

静态流式多处置惩罚器(SM)分区

作为 MPS 中现有的动态执行资源供应(provisioning)的一种替换计划,静态流式多处置惩罚器(SM)分区是针对 NVIDIA Ampere 架构(盘算能力 8.0)及更新 GPU 的一项特征,它为 MPS 客户端提供了一种建设独吞 SM 分区的要领。

该模式通过使用 -S 或 --static-partitioning 标记启动 MPS 控制守护历程来启用,其主要目的是提供确定性的资源分派,并改善 MPS 客户端之间的隔离性。分区的基本单位是一个「Chunk」(块),其巨细凭证 GPU 架构而异 —— 例如,在 Hopper(盘算能力 9.0)及更新的自力 GPU 上,一个 Chunk 包括 8 个 SM。

cuBLAS 中的双精度和单精度模拟

虽然严酷来说这不属于 CUDA 13.1 的更新,但 NVIDIA CUDA Toolkit 13.0 中的 cuBLAS 更新引入了新的 API 和实现,旨在提升双精度(FP64)矩阵乘法(matmul)的性能。

这是通过在 NVIDIA GB200 NVL72 和 NVIDIA RTX PRO 6000 Blackwell Server Edition 等 GPU 架构的 Tensor Core 上举行浮点(FP)模拟来实现的。

开发者工具

开发者工具是 CUDA 平台的主要组成部分。此次宣布带来了多项立异和功效增强,包括:

CUDA Tile 核函数性能剖析工具

在摘要页新增「Result Type」(效果类型)列,用于区分 Tile 核函数与 SIMT 核函数。

详情页新增「Tile Statistics」(Tile 统计)部分,总结 Tile 维度和主要管线(pipeline)的使用率。

源码页支持将指标映射到高层级的 cuTile 核函数源码。

源码页

Nsight Compute 剖析,重点展示了剖析输出中的 Tile Statistics 部分

此次宣布的 Nsight Compute 还增添了对装备端启动的图(device-launched graphs)中 CUDA 图节点的剖析支持,并刷新了源码页导航,为编译器天生和用户天生的标签提供了可点击的链接。

编译时修补

NVIDIA Compute Sanitizer 2025.4 通过 -fdevice-sanitize=memcheck 编译器标记,增添了对 NVIDIA CUDA 编译器(NVCC)编译时修补(patching)的支持。这种修补增强了内存过失检测能力,并提升了 Compute Sanitizer 的性能。

编译时插桩(instrumentation)可将过失检测直接集成到 NVCC 中,从而实现更快的运行速率,并通过高级的基址 - 界线剖析(base-and-bounds analysis)捕获更隐藏的内存问题(如相邻分派间的不法会见)。这意味着开发者可以在不牺牲速率的情形下调试内存问题,运行更多测试并坚持生产力。现在,该功效仅支持 memcheck 工具。

要使用此新功效,请使用如下 NVCC 标记编译代码:

nvcc -fdevice-sanitize=memcheck -o myapp myapp.cu

然后使用 memcheck 工具运行你的应用:

compute-sanitizer --tool memcheck myapp

NVIDIA Nsight Systems

NVIDIA Nsight Systems 2025.6.1 与 CUDA Toolkit 13.1 同步宣布,带来了多项新的追踪功效:

系统级 CUDA 追踪:--cuda-trace-scope 可开启跨历程树或整个系统的追踪。

CUDA 主机函数追踪:增添了对 CUDA Graph 主机函数节点和 cudaLaunchHostFunc () 的追踪支持,这些函数在主机上执行并会壅闭流(stream)。

CUDA 硬件追踪:在支持的情形下,基于硬件的追踪现在成为默认模式;使用 --trace=cuda-sw 可恢复为软件模式。

Green Context 时间轴行现在会在工具提醒中显示 SM 分派情形,资助用户明确 GPU 资源使用率。

数学库

焦点 CUDA 工具包数学库的新功效包括:

NVIDIA cuBLAS:一项全新的实验性 API,支持 Blackwell GPU 的分组 GEMM 功效,并兼容 FP8 和 BF16/FP16 数据类型。针对上述数据类型,支持 CUDA 图的分组 GEMM 提供了一种无需主机同步的实现方法,其装备端形状可实现最高 4 倍的加速,优于 MoE 用例中的多流 GEMM 实现。

NVIDIA cuSPARSE:一种新的希罕矩阵向量乘法 (SpMVOp) API,与 CsrMV API 相比性能有所提升。该 API 支持 CSR 名堂、32 位索引、双精度以及用户自界说的后缀。

NVIDIA cuFFT:一套名为 cuFFT 装备 API 的全新 API,提供主机函数,用于在 C++ 头文件中盘问或天生装备功效代码和数据库元数据。该 API 专为 cuFFTDx 库设计,可通过盘问 cuFFT 来天生 cuFFTDx 代码块,这些代码块可以与 cuFFTDx 应用程序链接,从而提升性能。

针对新的 Blackwell 架构,现已推出性能更新。用户可选摘要害 API 举行更新,并审查性能更新详情。

cuBLAS Blackwell 性能

CUDA Toolkit 12.9 在 NVIDIA Blackwell 平台上引入了块缩放的 FP4 和 FP8 矩阵乘法。CUDA 13.1 增添了对这些数据类型和 BF16 的性能支持。图 2 显示了在 NVIDIA Blackwell 和 Hopper 平台上的加速比。

在 NVIDIA Blackwell 和 Hopper 平台上的加速比

cuSOLVER Blackwell 性能

CUDA 13.1 继续优化用于特征剖析的批处置惩罚 SYEVD 与 GEEV API,并带来了显著的性能增强。

其中,批处置惩罚 SYEV(cusolverDnXsyevBatched) 是 cuSOLVER 中 SYEV 例程的统一批处置惩罚版本,用于盘算对称/Hermitian 矩阵的特征值与特征向量,很是适合对大宗小矩阵举行并行求解的场景。

图 3 展示了在批巨细为 5,000(矩阵行数 24–256)的测试效果。与 NVIDIA L40S 相比,NVIDIA Blackwell RTX Pro 6000 Server Edition 实现了约 2 倍的加速,这与预期的内存带宽提升相吻合。

在批巨细为 5000(矩阵行数 24–256)的测试效果

关于复数单精度和实数单精度两类矩阵,当行数N = 5时,加速比约为1.5×,并随着行数增大逐渐提升,在N = 250 时抵达 2.0×。

图 4 显示了 cusolverDnXgeev (GEEV) 的性能加速比,该函数用于盘算一样平常(非对称)浓密矩阵的特征值和特征向量。GEEV 是一种混淆 CPU/GPU 算法。单个 CPU 线程认真在 QR 算法中执行高效的早期降阶处置惩罚,而 GPU 则处置惩罚其余部分。图中显示了矩阵巨细从 1,024 到 32,768 的相对性能加速比。

cusolverDnXgeev (GEEV) 的性能加速比

当矩阵行数n = 5000时,加速比约为1.0,并随着矩阵规模增大逐渐提升,在n = 30000 时抵达约 1.7。

NVIDIA CUDA 焦点盘算库

NVIDIA CUDA Core 盘算库 (CCCL) 为 CUB 带来了多项立异和增强功效。

确定性浮点运算简化

由于浮点加法不具备连系律,cub::DeviceReduce 历史上只能包管在统一 GPU 上每次运行获得位上完全相同的效果。这被实现为一个两遍算法。

作为 CUDA 13.1 的一部分, NVIDIA CCCL 3.1 提供了两个特另外浮点确定性选项,您可以凭证这些选项在确定性和性能之间举行权衡。

不包管:使用原子操作举行单次归约。这不可包管提供位上完全相同的效果。

GPU 间:基于 Kate Clark 在 NVIDIA GTC 2024 大会上演讲中可复现的降维效果。效果始终逐位相同。

可以通过标记位设置确定性选项,如下面的代码所示。

演示代码

数据比照

更便捷的单相 CUB API

险些所有 CUB 算法都需要暂时存储空间作为中心暂存空间。已往,用户必需通过两阶段挪用模式来盘问和分派须要的暂时存储空间,若是两次挪用之间转达的参数纷歧致,这种模式既繁琐又容易蜕化。

CCCL 3.1 为一些接受内存资源的 CUB 算法添加了新的重载,从而用户可以跳过暂时存储盘问 / 分派 / 释放模式。

演示代码

CUDA Tile 资源链接:https://developer.nvidia.com/cuda/tile

CUDA Toolkit 13.1 下载地点:https://developer.nvidia.com/cuda-downloads

https://developer.nvidia.com/blog/focus-on-your-algorithm-nvidia-cuda-tile-handles-the-hardware

https://developer.nvidia.com/blog/nvidia-cuda-13-1-powers-next-gen-gpu-programming-with-nvidia-cuda-tile-and-performance-gains

https://x.com/NVIDIAAIDev/status/1996976702732620271

https://developer.nvidia.com/blog/simplify-gpu-programming-with-nvidia-cuda-tile-in-python

? THE END

本文来自微信公众号“机械之心”,36氪经授权宣布。

??时势1:别告诉妈妈正式版官网

??12月09日,连续8年送童装 浙江织里“爱心墙”累计捐出2万件,

  三、坚持优异的心态。

,久艹网。

??12月09日,国际锐评丨解决芬太尼危机,美方求人不如求己,

  增强五种意识。即要增强政策意识、学习意识、法制意识、效劳意识和生长意识。增强政策意识。就是要善于用党的政策来调动群众的起劲性,凝聚人心。要以宣讲中央1号文件来切实减轻农民肩负为契机,以建设情形整治来净化社会民俗、优化投资情形为栽体,增强对农业政策、征地拆迁等方面的学习与宣传,并严酷按政策效劳,以坚持农村的阵势稳固,增添农民的正当收入。增强学习意识。村级组织植根于农村,但又不完全等同于农民,在头脑意识方面、在掌握科学手艺上、在看法转变上、在政策理论水平上都应高于农民。只有这样,才华在致富奔小康的蹊径上走在农民的前线,并且能够向导农民配合致富。因此,我们村级下层干部,尤其是我们新进来的年轻干部要作育一直学习的习惯,通过一直的学习,掌握更富厚的科学文化知识,指导生产实践和事情实践,一直增强驾驭农村经济生长的能力,为“三农”做出更大孝顺。增强法制意识。就是要善于运用执法来处置惩罚农村中泛起的种种矛盾、纠纷,在农村,尤其是在我们,村级干部依法效劳的主要使命是切实做好村务果真事情,各村做到村务真果真和全方位果真,规范果真内容和果真程序,并建设起响应的果真的包管机制和村民加入治理的一系列制度,理顺群众情绪,亲近干群关系。自去年区划调解、今年换届选举以来,特殊是各村的财务方面,是否抵达“并村、并人、并帐”的效果,这是农民体贴的热门和焦点问题。增强效劳意识。就是要善于运用典范树模、说服教育、有用效劳的事情要领做好农村事情,把治理事情转化为效劳事情,起劲为群众的生产、生涯提供有用效劳,切实帮群众排忧解难,做群众的“知心人”。要从已往旧的头脑看法中解放出来,把心思放在琢磨农民需要什么,我就为农民做些什么上。从基础上彻底转变事情方法,更好的为农村经济效劳。增强生长意识。今年是我县的“项目建设年”,全县108个项目,我镇就占其中的26个项目,怎样启动完成这26个项目,就是我们今年镇、村整年岁情的焦点与重心,各村都要迅速明确好事情职责,理顺好事情思绪,落实好各项步伐,以“敢做事、会做事、干好事”的精神,推进整年岁情的前进。同时,我们列位下层干部要起劲提高生长农村经济事情的指导水平,千方百计壮大整体经济实力,使农村下层组织具备为农民效劳的经济基础,从而增强村“两委”班子的凝聚力和战斗力。

,黄片高清无码免费看,俄罗斯熟妇淫荡视频,中文字幕www.。

??时势2:3D同人.com

??12月09日,俄罗斯戏剧邂逅京剧 广西桂林上演别样《樱桃园》,

  二是牢牢围绕增添农民收入这一中心,起劲推进新农村建想程序。要凭证“生产生长、生涯宽裕、乡风文明、村容整齐、治理民主”的社会主义新农村建设要求,在重点使命的落实上迈出新步子,钻营新突破。今年春种以来,乡域内总的降水量较往年相比有所增多,现在为止没有体现出严重的旱情,可是近期又泛起了一连的高温天气,我们绝不可麻木大意,要一如既往的认真抓好抗旱防旱事情,做好水库水的治理,尽最大起劲包管丰产丰收。进一步加大对制种市场的羁系力度和制种农户的田间治理培训,确保今年全乡制种业康健生长。目今番茄即将进入采摘期,各村要未雨绸缪,做到早妄想,早安排,及早落实今年的番茄收购事情,确保收购顺遂。认真落实“抓大户、建小区、带群体”的事情思绪,用足用活县政府关于生长养殖业的津贴政策,接纳宣传引、政策扶、典范带、行政推等步伐,进一步引发群众生长草畜工业的内在动力,突出抓好几个养殖小区的建设;注重青贮氨化手艺的推广和畜禽新品种的引进,提高草畜工业生长的科技含量;进一步施展乡畜牧站的职能作用,健全防疫网络,增强畜禽防疫和疫病防治事情,力促全乡畜牧业生长再上新台阶。要起劲在劳务经济生长上求突破。生长劳务经济是镌汰农民、富足农民、提高农民素质的一项战略性使命,也是投入少、收效快的富民工程,是现阶段增添农民收入的主要途径。连系30万农村劳动力手艺培训工程和全民创业工程,充分验展乡劳务站的职能作用,增强劳动力手艺和科技培训,生长壮大农村适用人才步队,作育和作育一大批有文化、懂手艺、善谋划、会治理的乡土人才,多条理、多形式、全方位提高劳动力素质,逐步推动劳务输出由体力型向手艺型转变,提高劳务输出事情的质量和层次。继续凭证牢靠东部,拓展西部,是非连系,季节交织的思绪,坚持政府指导、中介组织推动、市场化运作的原则,持之以恒地抓好劳务输出。力争年底实现输出劳力 人次以上,实现劳务收入 万元。

,裸体美女的隐私秘 软件,一级二级视频美女特黄A片,欧美一级爽AAAAA片。

??12月09日,【新疆故事】苗利辉:研究克孜尔石窟是我一生的奋斗目标,

  ③建设“学习型组织”。

,男女性色大片免费网站视频,甘雨涩涩漫画,扒开她的小缝让我㖭吮日本电影。

??时势3:欧美激情一区

??12月09日,上海市两会观察:数字科技融合文创,如何催生新消费模式?,

  “碎!”

,91女高中生露x给我玩,性爽爽,A片欧美黄色视频。

??12月09日,文旅创新需务实可行,

  11月9日是“天下消防日”,11月9日的日数恰恰与火灾电话号码119相同,并且这一天前后,正值风干物燥,火灾多发的季节,天下各地都在密锣紧鼓地开展防火事情。为了增强全民的消防清静意识,我国就将每年的11月9日定为天下的“消防宣传日”。

,欧美一级A片视频在线,免费的黄网站和视频,妺妺窝人体色777777小馒头。

??时势4:国产原创视频网站

??12月09日,(经济观察)人民币对美元创年内最低值 专家析破7.3后走势,

  小不点受惊,这个说法十分恐怖,远超人族现在所盛行的标准。

,俄罗斯网站人人草人人干在线观看,播放一部黄色一级片久久精品,在线观看人成视频色9。

??12月09日,盖“被子”帮冰块度夏 从哈尔滨存冰有道看科技保温妙招,

  突然,石毅传音,得宗老配合,罗致其汪洋般的精气神,滋养己身。他的重瞳发光,射出一片符文,烙印虚空中,密密麻麻,竟影响了天地间的所有宝术,强烈滋扰了石子陵的攻伐。

,操老女人的逼逼毛毛片黄色网站,免费观看已满十八岁电视剧彩漫画,把女人弄爽特黄a大片APP。

责编:陈光力

审核:梁泽铿

责编:孙仰法

相关推荐 换一换

Copyright (C) 2001-   dzwww.com. All Rights Reserved

新闻信息效劳允许证 - 音像制品出书允许证 - 广播电视节目制作谋划允许证 - 网络视听允许证 - 网络文化谋划允许证

山东省互联网传媒集团主理  联系电话:0531-85193202  违法不良信息举报电话:0531-85196540

鲁ICP备09023866号-1   鲁公网安备 37010202000111号  

Copyright (C) 2001- Dzwww   鲁ICP备09023866号-1

网站地图