本地 AI 自己跑起来了:英伟达 RTX Spark 十月开售

本地 AI 喊了这么多年,硬件不缺、模型也越做越强,可真到自己电脑上跑起来,总差那临门一脚。卡点老一套:挑模型、配推理服务、调量化、追更新,一套折腾下来,热情先凉半截。IFA 2026 上,英伟达带着微软和一批合作伙伴一起把这条路往前推了一大截:llama.cpp 与 vLLM 推理优化全面铺开,几款主流智能体应用在 RTX 显卡上一键就能开跑,闲置电脑也能被唤醒来分担算力。问渠那得清如许,为有源头活水来,本地 AI 这一池水,今年总算活泛起来了。

今天发布的内容,拢共三件大事:

- RTX 显卡上的本地 AI 支持大幅简化,Hermes Agent、OpenClaw、Perplexity Portable Computer 三款主流智能体应用都接入了简化版本地模型配置;

- 推理速度再上一档,llama.cpp 与 vLLM 推出新优化,单卡推理性能最高提升至原来的 1.9 倍,LM Studio、Ollama 同步跟上;

- 英伟达 PAIR 面世,这款免费开源工具能把家里多台电脑串成一台"算力池",自动把任务派给最闲的那台。

紧随其后上市的英伟达 RTX Spark Windows 电脑将于十月开售,联想、宏碁已公布产品方案;艺电、Embark、育碧等游戏厂商正把 3A 大作陆续搬上 RTX Spark 平台。

刚刚过去的八月,本地 AI 圈也没闲着,模型一个接一个:

- 英伟达 Nemotron 3.5 Lightning 正式上线,300 亿参数,可在 RTX 电脑、RTX PRO 工作站、DGX Spark、Jetson 上跑;

- 智谱 GLM-5.3-Flash 是一款多模态 MoE 模型,主打智能体能力,跑在 DGX Station 上;

- 通义千问 Qwen3.8-Flash-Next(多模态 MoE 开源模型)与 Qwen3.8-27B(270 亿参数开源模型,主攻本地智能体与编程负载)双双发布,均可在 DGX Spark、DGX Station 及英伟达显卡上本地运行;

- LTX 2.5 是 LTX 推出的开放世界视频生成模型,专为 RTX 显卡、DGX Spark、DGX Station 优化,搭配 NVFP4、FastVideo、ComfyUI 升级,本地生成视频更快、更省显存;

- MiniMax-H3 是带同步音频的开源视频生成模型,可经 ComfyUI 在英伟达显卡上本地运行;FastVideo 与英伟达联合推出 FastH3(4 步蒸馏版),性能提升 7 倍,针对 RTX 显卡与 DGX Spark 的优化配方也即将推出;

- 脸书 Muse Glimmer 是 300 亿参数开源模型,主攻编程与智能体负载,可在 GeForce RTX 电脑、DGX Spark、DGX Station、Jetson 上本地运行;英伟达还推出 NVFP4 量化方案并已支持 DGX Spark,部署更省显存;

- DeepSeek v4 Flash 拥有 2840 亿参数(激活 130 亿)的 MoE 模型,可在 2 张 DGX Spark 集群或 DGX Station 上本地运行。

本地智能体,一键就能开跑

跑一个本地智能体,过去得自己挑模型、找兼容的推理服务、调量化参数、追更新。RTX 与 DGX 系统上,这些年最让人头疼的入门环节正在一关一关被拆掉。

当下三款最常用的智能体应用,将在 Windows 上提供简化版本地模型配置,全部基于 llama.cpp 构建,并预装英伟达最新的推理优化。新版配置流程把过去繁琐的手动操作压缩到最低,争取让"装好就能用"成为常态。

上个月,Perplexity 推出 Portable Computer 智能体,把模型、编排、工具打包成一个 App,在 Linux 上就能一键跑起来,首发适配英伟达 DGX Spark。现在它已支持搭载至少 24GB 显存的英伟达 RTX 显卡(Linux 先行),Windows 版本也即将上线,更多 PC 用户都能用上同款"开箱即用"。整套工作流可以全程在本地完成、不消耗积分;遇到需要额外研究或推理的环节,Portable Computer 才会向用户申请授权,把这一部分切到云端 15 款以上的前沿模型。敏感数据始终留在这台机器上,不会外泄。几个典型用法值得一看:

- 工程项目:让智能体去扫描已连接的 GitHub 仓库里的 PR,按"可直接合并、被卡住、已陈旧、待复审"分类,并标好下一步动作;文档若与最新合并内容脱节,会被自动发现并修正,再开一个 PR 把变更补回去;

- 财务分析:把两年的券商对账单、合并版 1099 税表、个税申报材料一起丢给智能体,让它去追那些"看似必要、实则徒增手续费与税负"的长期持仓,所有数字都精确到原始文件的具体页码,全程没有任何文件传到外部聊天工具;

- 创业团队:直接问"为什么最近激活率上不去",智能体本地分析漏斗数据,定位新用户从安装到完成首次任务之间的流失环节,再把核心洞察发到团队的 Slack 频道。

Hermes Agent 由 Nous Research 开发,是一款"全天候待命、越用越顺手"的通用型智能体,全球用户量以百万计。它不挑模型、不挑供应商,长期跑在本地系统上正合适,RTX 电脑、RTX PRO 工作站、DGX Spark 都是它的天然主场。在 Hermes 里配置本地模型,Windows 上的 RTX 与 DGX 系统都能做到一键搞定:智能体会自动识别英伟达显卡,挑出合适的模型与配置,再通过内置的、已预装英伟达推理优化的 llama.cpp 跑起来,彻底免去手动下载与调参的麻烦。Linux 版本的支持也快来了。

跑起来之后,Hermes 的工作方式与在别处无异:调用工具、跨任务维持上下文、跨会话记忆、持续沉淀可复用技能,用得越久越能干。把模型放在本地 GPU 上跑,性能不打折,数据也始终留在这台机器。

一键本地模型配置已上线 Windows,Linux 支持也即将到来。

OpenClaw 是开源智能体运动中最具代表性的项目之一,GitHub 上已斩获 38 万星标,社区围绕研究、工程、项目管理、日常办公等用例,搭起了一整套工具与技能生态。英伟达、微软与 OpenClaw 团队三方合作,把 Windows PC 上的入门门槛一压再压。新版 OpenClaw Windows App 把"在 RTX 显卡上搭一套优化好的本地模型"这件事化繁为简,只需显存 24GB 及以上的 RTX 显卡即可上手。

推理性能再提速

本地智能体要"随叫随到",推理性能是命根子。英伟达持续与开源社区 llama.cpp、vLLM 协作,把智能体负载在自家硬件上的推理速度一压再压。

Llama.cpp 与 vLLM 在 GeForce RTX 5090、RTX PRO 6000 Blackwell、2x DGX Spark 上的本地推理吞吐对比

llama.cpp 在 GeForce RTX 5090 上经过内核优化、增强的投机解码(speculative decoding)以及更快的预填充(prefill)阶段后,吞吐最高提升至原来的 1.9 倍。几年内核优化的积累厚积薄发,单卡跑本地智能体再也不必忍受"等一个字蹦一个字"的尴尬。

vLLM 在 RTX PRO 6000 Blackwell 工作站版上达到 1.2 倍,在两张 DGX Spark 组成的集群上达到 1.4 倍;FlashInfer 引入新的 XQA 注意力内核,并配合后端优化,让两类硬件平台上的推理都跑得更顺。

这些性能提升已通过 llama.cpp 与 vLLM 推理后端开放,用户也可以直接通过 LM Studio、Ollama 这两款应用体验到。

闲置电脑一起上:英伟达 PAIR

美国家庭里,超过一半拥有两台或以上电脑。这些机器白天大多闲着,CPU、GPU 一起打盹。英伟达 PAIR(Personal AI Router,个人 AI 路由器)就是一款免费开源软件,把它们一股脑拉起来给本地 AI 打下手。

智能体工作流常把复杂任务拆成若干并行小任务,若所有请求都挤在同一张 GPU 上,性能就容易卡壳。PAIR 会自动发现本地网络里兼容的电脑,把彼此独立的推理请求派给当前最闲的那台。它与 Ollama、LM Studio 直接打通,设备增减也能动态适应。

比如,让 Hermes 帮你做一份"周日复盘"清单:先把凌乱的邮箱按"现在必须处理、可以缓一缓、直接略过"分类。Hermes 把任务拆给多个子智能体,PAIR 再把这些活派到家里所有可用的电脑上,而不是让它们挤在同一张 GPU 上干等。

结果是本地智能体拿到更多算力,任务并行度更高;当主电脑在打游戏、做内容或忙别的事时,AI 负载也能顺手挪到另一台。

英伟达 PAIR 测试版支持 Windows、macOS、Linux,同时提供图形与终端两种界面;硬件覆盖英伟达 GeForce RTX 20 系及更新显卡、RTX PRO 工作站显卡(图灵架构及更新)、英伟达 DGX Spark,以及 Apple M4 及更新芯片。

本地修图:CyberLink PhotoDirector AI PC 模式

开源图像与视频模型让创作者可以在 PC 上"摆弄"各种生成式 AI 模型,反复试错、快速迭代,告别"算力焦虑",也让更多创作过程留在这台机器上。

讯连科技 CyberLink 新出的 PhotoDirector AI PC 模式,是最早把扩散模型直接装进创作软件的几款产品之一,把这些模型变成艺术家手边即取即用的工具。AI PC 模式将随 PhotoDirector 365 一同推出,并针对英伟达 RTX Spark 做优化,提供生成式编辑、图像增强、杂物与路人移除、背景替换与移除、人像精修、从零生成全新画面等能力;任务简单就本地完成,任务复杂就上云,灵活性按需取舍。

在英伟达显卡上,PhotoDirector 通过 TensorRT-RTX 与 FP8 加速本地 AI。

RTX Spark 十月登场

英伟达 RTX Spark 将于今年十月正式开售,IFA 2026 上合作伙伴已经提前亮出家底。除了此前宣布将于十月出货的六家 OEM,宏碁展示了紧凑型桌面 RTX Spark 概念机,联想则公布了 Yoga Pro 9n 与 Yoga 9n 二合一两款新品。

RTX Spark 称得上是 Windows PC 的新起点。一台机器同时照顾创作者、游戏玩家与 AI 智能体:搭载一颗 1 Petaflop 的 RTX Blackwell GPU、最高 128GB 统一内存、20 核 Grace CPU,整机能效比相当出彩。这块"超级芯片"让轻薄本也能撑起全天候续航,让紧凑型台式机也能 7×24 小时挂着智能体不喘气。配合全新的 Windows Agent 套件,智能体可以在系统级管控下、在后台安全地长期运行。

上周的 Gamescom 上,艺电、Embark、育碧等游戏厂商相继宣布把 3A 大作搬上 RTX Spark Windows PC,与五月台北电脑展上首批公布支持的 KRAFTON、网易、拳头(Riot Games)、Xbox 汇合。

顺带一提

游戏迷的福音:英伟达在 Gamescom 上推出 DLSS 4.5 Ray Reconstruction,用第二代 Transformer 模型提升光线追踪与路径追踪游戏的画面质量;同时公布《007 First Light》、《CONTROL Resonant》、《Gears of War: E-Day》等新作的 RTX 支持,RTX Spark 的游戏阵容也进一步扩大。

DeepSeek Harness 上线:DeepSeek 推出新的开源 Harness,与 DeepSeek-V4-Flash 配合,可在英伟达 DGX Station 与多卡 DGX Spark 上为本地智能体编程工作流提效。

MLPerf Client v2.0 扩展 AI PC 基准:MLCommons 与英伟达等业界伙伴共同发布 MLPerf Client v2.0,新增针对智能体 AI 与图像生成的基准测试,并扩充了面向真实本地 AI 负载的大模型测试项。

展开阅读全文

更新时间:2026-09-11

标签:科技   英伟   模型   智能   显卡   电脑   负载   性能   显存   工作站   工作流

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号

Top