news 2026/8/13 11:12:17

黄仁勋“站台开源”后首款模型落地:英伟达正式推出 Nemotron 3.5 Lightning,单张 GPU 即可运行

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
黄仁勋“站台开源”后首款模型落地:英伟达正式推出 Nemotron 3.5 Lightning,单张 GPU 即可运行

黄仁勋“站台开源”后首款模型落地:英伟达正式推出 Nemotron 3.5 Lightning,单张 GPU 即可运行

当地时间 8 月 11 日,英伟达正式宣布推出开源 AI 模型Nemotron 3.5 Lightning。这是英伟达 CEO 黄仁勋上月底在 X 平台首次发声、公开表态支持开源模型后,英伟达发布的首款开源模型。

一个月前,黄仁勋联合 25 家科技巨头签署公开信,力挺开源 AI。一个月后,他用一款实实在在的产品,兑现了“开源”的承诺。现在看来整个事件都是一场商业的布局的精准落子,步步为营,英伟达以一种全新的方式加入了AI战局。

一、专为“执行”而生:300 亿参数,单次只激活 30 亿

Nemotron 3.5 Lightning 是一款300 亿参数的混合专家(Mixture-of-Experts, MoE)模型。MoE 架构的核心优势在于:虽然总参数达 300 亿,但每次推理只激活约 30 亿参数

这意味着,它用“小模型的计算成本”实现了“大模型的容量”。

英伟达对这款模型的定位非常清晰——它不是用来取代前沿推理模型的,而是成为多智能体系统里的“执行型”模型。在一个复杂的企业 AI 系统里,大模型负责任务规划和复杂推理,Nemotron 3.5 Lightning 则承担大量代码审查、安全监控、数据处理、告警分析这类专业化工作。

用英伟达的话说:“前沿推理模型可以规划和协调工作流,而像 Lightning 这样的小型专用模型可以执行目标任务。”

二、性能炸裂:输出速度提升 4 倍,任务提速 30%

作为一款主打“效率”的模型,Nemotron 3.5 Lightning 的性能数据相当亮眼:

速度层面:相比同类模型,输出速度最高可提升4 倍,智能体任务整体完成速度加快 **30%**。在预发布测试中,其输出速度接近每秒 670 个 token

精度层面:在衡量智能体实际工作效率的PinchBench基准测试中,它达到了86% 的准确率,同时在完成 10000 个任务的速度上,比同等准确率的 Qwen3.6 35B 快了约 **30%**。

第三方评测:在 Artificial Analysis 的 Intelligence Index 中,Nemotron 3.5 Lightning 得分24,与 OpenAI 的 gpt-oss-120b 持平。在代理任务相关的GDPval-AA v2评测上,其 Elo 达到824,超越了 Nemotron 3 Super 和 gpt-oss-120b。

推理优化:模型支持推测解码多令牌预测技术,并配备 DFlash 和 DSpark 两个辅助模型,可在多种服务场景下实现更全面的推理优化。

三、真正“平民化”:单张 GPU 可跑,随时随地部署

Nemotron 3.5 Lightning 最令人惊喜的特点,是它的轻量化

据 CNBC 报道,这款模型“轻量高效”,可在普通笔记本电脑或台式机的单块 GPU 上流畅运行。具体支持的平台包括:NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station 以及 NVIDIA Jetson 系列

同时,它也可无缝扩展至边缘 AI 设备、RTX PRO 工作站、数据中心及云端环境

部署生态方面,模型已获得广泛支持,包括Ollama、LM Studio、Amazon SageMaker JumpStart、Google Cloud、Microsoft Foundry 和 Oracle Cloud Infrastructure等主流平台。

四、开源诚意:权重、数据、配方全开放

Nemotron 3.5 Lightning 的开源程度,超越了多数“开源”模型——不只是模型权重,训练数据和训练配方也一并开放

模型采用OpenMDW-1.1 开源协议发布。开发者可以:

  • 使用NeMo AutomodelNeMo Megatron Bridge进行 LoRA 或全量微调

  • 使用NeMo RLNeMo Gym运行强化学习和基于环境的评估

  • 将英伟达的后训练数据与企业自有数据混合,定制专属模型

英伟达生成式 AI 副总裁 Kari Briski 用了一个形象的比喻:“这正在把后训练和微调变成把碗放进洗碗机、然后按下启动键。”

低成本定制的案例已经出现:CodeRabbit 用英伟达的标准模型配方训练了一个 epoch,约两小时、花费 85 美元就产出了一个路由智能体。另一个合作伙伴用单张 H100 卡就完成了训练。

五、配套发布:NeMo Switchyard——解决“模型太多,谁来调度”

与 Nemotron 3.5 Lightning 同步发布的,还有一款开源模型路由库 ——NeMo Switchyard

它的作用是:在智能体工作流的每一步,把请求路由到最适合该任务的模型。复杂请求交给强大的推理模型,常规执行任务交给 Nemotron 3.5 Lightning。

这一发布揭示了一个关键趋势:当模型足够多之后,“路由”正在成为新的软件层。企业选模型的标准,正在从“哪个最强”转向“哪个够用、哪个快、哪个划算”

六、行业落地: CrowdStrike、Harvey、CodeRabbit 已率先采用

Nemotron 3.5 Lightning 并非停留在实验室阶段,多个行业头部玩家已在定制和使用:

  • CrowdStrike:用于网络安全领域

  • Harvey with Trajectory:用于法律服务

  • CodeRabbit with Baseten:用于代码审查

  • Lila Sciences:利用它提高物理和生命科学领域智能体任务的推理能力

  • Fastino Labs:在软件开发、金融和医疗工作负载方面取得了领先的准确性

写给开发者

1. 别再拿“大模型”干“小活”了

Nemotron 3.5 Lightning 传递的信号非常明确:未来的 AI 系统是多模型系统,而不是单模型通吃。大模型负责规划和推理,小模型负责高频执行。开发者在设计 AI 应用时,应该从“选一个最强的模型”转向“为每个任务选最合适的模型”

2. 开源模型正在“平民化”推理成本

单张 GPU 可跑、85 美元微调出一个智能体——这意味着中小团队也能拥有定制化 AI 的能力,不再需要为每次推理支付高昂的 API 费用。对于创业公司和个人开发者,这是一个值得认真评估的机会。

3. 英伟达的战略:从“卖芯片”到“卖整个 AI 工作流”

Nemotron 3.5 Lightning + NeMo Switchyard 的组合,本质上是在构建一个完整的 AI 工作流生态。开源模型用得越多,GPU 需求越大——英伟达正在用软件生态巩固自己的硬件护城河。

4. 模型已上线,现在就可以下载

Nemotron 3.5 Lightning 已在Hugging FaceModelScope平台同步上线,全球开发者可免费下载、使用和修改,无需向英伟达付费或申请额外许可。

写在最后

从黄仁勋在 X 平台发布第一条推文力挺开源,到 Nemotron 3.5 Lightning 正式上线,刚好过去三周。

这款模型的意义,不只是“又一个大模型开源了”——它标志着英伟达正在从“AI 算力的卖水人”走向“AI 工作流的定义者”。当芯片巨头亲自下场定义“什么样的模型该跑在什么样的硬件上”,整个 AI 开发范式的底层逻辑,正在被重新书写。

正如黄仁勋上月底所说:“优秀的开源 AI 大模型对整个行业大有裨益。”现在,他用一款产品证明了这句话不只是说说而已。

关键词标签:#英伟达 #Nemotron3.5Lightning #开源模型 #AI智能体 #MoE #黄仁勋 #NeMoSwitchyard #大模型 #AI开发者 #HuggingFace

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/13 11:11:32

注意力机制全景图:从核心原理到主流变体与工程实践指南

1. 项目概述:为什么我们需要盘点注意力机制? 如果你最近在关注大语言模型或者计算机视觉的进展,几乎不可能绕过“注意力机制”这个词。从Transformer架构一统NLP江湖,到各种视觉Transformer模型在CV任务上大放异彩,注意…

作者头像 李华
网站建设 2026/8/13 11:10:02

5分钟搭建个人云端相册:Lychee开源相册系统完全指南

5分钟搭建个人云端相册:Lychee开源相册系统完全指南 【免费下载链接】Lychee A great looking and easy-to-use photo-management-system you can run on your server, to manage and share photos. 项目地址: https://gitcode.com/gh_mirrors/ly/Lychee 还在…

作者头像 李华
网站建设 2026/8/13 11:09:16

Nginx-ngx_http_log_module

一、引言:被当作“配置项”的C语言引擎在绝大多数Nginx文档和教程中,access_log和log_format被归类为“基础配置”。但当你翻开Nginx源码,会发现它们背后是一个完整的C模块——ngx_http_log_module。这个模块不是简单的fprintf封装&#xff0…

作者头像 李华
网站建设 2026/8/13 11:07:58

Kimi K3实战测评:99元AI编程助手如何重塑开发者工作流

1. 项目概述:一次“付费”的AI生产力革命体验作为一名在代码堆里摸爬滚打了十多年的老程序员,我自诩对各种“新玩具”早已免疫。从早期的代码补全插件,到后来的Copilot,再到层出不穷的各类AI编程助手,我始终保持着一种…

作者头像 李华
网站建设 2026/8/13 11:07:55

手写AI编程助手:从零构建基于Agent与Tool的自动化系统

1. 项目概述:为什么我们要手写一个“最小版本”的Cursor?最近在AI编程工具圈里,Cursor这个名字可以说是如雷贯耳。它凭借深度集成大语言模型(LLM)的能力,将代码补全、解释、重构甚至整个功能的生成都提升到…

作者头像 李华