AMD 押注个人 AI:192GB 统一内存本地跑 3000 亿参数模型,DeepSeek、千问装进一台电脑意味着什么
一台比 Xbox Series X 还小的机器,不联网、不买云服务,就能在桌上跑起 3000 亿参数的大模型。这不是实验室里的概念机,而是 AMD 在 Advancing AI 2026 大会上把「个人 AI」重新定义的一次硬推。
AMD 把新一代处理器 Ryzen AI Max PRO 400 系列(代号 Gorgon Halo)搬上了台面。核心数字很直白:192GB 统一内存、其中最高 160GB 可直接当显存用、内存带宽 273GB/s。按 4 位量化测算,这台机器能完整加载约 300B(3000 亿)参数规模的模型——而上一代 Strix Halo 上限还停在 128GB 内存、约 200B 参数。从 2000 亿到 3000 亿,AMD 直接把本地 AI 的天花板抬高了 50%。
问题也随之而来:当「大模型必须上云」的常识被一台台式机打破,DeepSeek、千问这类开源权重模型被装进普通人的电脑,这到底意味着什么?
一、Gorgon Halo 把门槛从 200B 拉到 300B
AMD 官方新闻室在 Advancing AI 2026 的更新中确认,Ryzen AI Max PRO 400 系列配备最高 192GB 统一内存,支持运行最高 300B 参数规模的模型,搭载该芯片的开发者平台将在今年晚些时候通过 OEM 系统推出。换句话说,过去只能躺在数据中心里的巨型模型,现在被 AMD 塞进了一块消费级芯片。
硬件细节值得拆开看。据新浪科技与 k.sina 的报道,旗舰型号 Ryzen AI Max PRO 495 为 16 核 32 线程 Zen 5 架构,基础频率 3.1GHz、加速最高 5.2GHz,集成 Radeon 8065S 显卡(40 个 RDNA 3.5 计算单元),NPU 算力 55 TOPS,整机合计 131 TOPS。相比上一代 395 的 126 TOPS,提升了 5 个 TOPS,但真正的跃升在内存:从 128GB LPDDR5X-8000 升级到 192GB LPDDR5X-8533,VRAM 分配上限从 96GB 拉到 160GB。
CPU News 的报道点出一个关键背景:AMD 计算与图形事业群产品行销副总裁 Michael Nordquist 在会上介绍,统一内存容量比竞争对手目前最高 128GB 配置高出 50%,目的就是让地端设备能处理参数规模更大的生成式 AI 模型,包括腾讯与 DeepSeek 近期推出的模型。
更关键的是生态铺开速度。CPU News 称,目前已有超过 35 款设备准备支援 Halo 架构,涵盖笔记本、一体机与开发者迷你电脑,合作品牌包括 HP、宏碁、华硕与联想。AMD 已确认惠普和联想将在 2026 年第三季度(9 月底前)推出搭载该芯片的商用系统。
二、一台电脑,能装下哪些模型
最直观的落地,是各家 mini 工作站的实测演示。据凤凰网科技报道,铭凡(MINISFORUM)推出的 MS-S1 MAX-P495 搭载 495 旗舰芯片,可在本地直接运行 284B 参数的 DeepSeek V4 Flash 大模型,采用 Q4 量化,推理速度约 15 tok/s;122B 级模型用 Q8 量化可达约 27 tok/s,并支持 131K 完整上下文常驻。
驰为(CHUWI)在 IFA 2026 发布的 UniBox AI495 Pro 更把机身压到了 2.9 升,尺寸仅 209.6×209.6×67 毫米,同样塞进 192GB 统一内存和 131 TOPS 算力,能在本地完整运行百度 ERNIE 4.5 300B(3000 亿参数 MoE 架构)模型,数据全程不出本地。新浪财经转载的快科技消息称,这台机器比 Xbox Series X 还小,却相当于一台配了高端独显的工作站。
框架机(Framework)在 AMD 大会上展示的桌面 PC 原型机配 192GB 内存,现场以 Q8 精度运行 DeepSeek V4-Flash 仍有富余空间容纳更长上下文;TheOutpost.AI 报道,其概念集群方案用两块 50GbE 网卡做 RDMA,把两台 495 桌面的 384GB 内存池化,做分布式推理。
开源模型的本地化意义在集群演示里更清楚:TheOutpost.AI 援引 Wccftech 数据称,铭凡称两台 MS-S1 MAX-P495 能以 16 tok/s 跑通千问 Qwen3.5 397B 模型,四机集群则扛下了 380GB Q4_0 版本的 DeepSeek-R1 671B。过去这些模型只能上云,现在被拆进数台桌面机。

三、为什么是内存,而不是算力
这里有个反常识的现象:本地跑大模型,瓶颈从来不是算力,而是内存容量和带宽。
k.sina 的报道算了一笔账:传统笔记本独显通常只配 8—24GB 显存,难以加载 700 亿参数以上的模型;即便用 4 位量化,700 亿参数模型仍需约 38—40GB 空间,超出大多数便携硬件极限。而 AMD 的 3000 亿参数宣称基于 4 位量化精度——3000 亿参数约占 150GB 存储空间,在 160GB VRAM 中留出约 10GB 余量给键值缓存,理论上可行。
真正让这件事成立的,是统一内存架构。过去 CPU 和 GPU 各用各的内存池,模型权重要从系统内存经 PCIe 总线拷贝到显存;PCIe Gen4 实用带宽约 32GB/s。Gorgon Halo 让 CPU 和 GPU 访问同一块物理地址空间,无需复制,内存池以约 273GB/s 的速度运行。尽管这低于数据中心级 HBM3 加速器,但对便携式推理已足够。
所以 192GB 这个数字,本质是在和「显存墙」较劲。据 k.sina 拆解,Ryzen AI Max+ 395 支持到 70B Q4 和 200B MoE 模型,而 495 把支持上限拉到 120B Q4 和 300B MoE,模型容量提升约 60%。AMD 把芯片定位为本地大模型推理和边缘 AI 计算的顶级方案,逻辑正在于此。
四、AMD 与英伟达的两条路
正面撞上的,是英伟达的 DGX Spark。k.sina 的对比很直接:DGX Spark(桌面个人 AI 计算机)和即将推出的 RTX Spark 采用 ARM CPU 搭配 Blackwell GPU,提供 128GB 统一内存。AMD 在内存容量(192GB vs 128GB)和 VRAM 分配上占明显优势。
但另一边,英伟达在训练工作负载上仍有护城河。k.sina 指出,英伟达凭 Blackwell 架构专用的 FP4/FP8 稀疏加速张量核心,以及成熟的 CUDA 软件生态,优势显著;对需要在设备上微调或训练模型的开发者,英伟达平台更具吸引力。AMD 的大内存配置,更适合推理、智能体工作流和设备端数据处理这类用例。
x86 架构则是 AMD 的另一张牌。k.sina 报道,该平台支持 PyTorch、vLLM、llama.cpp、Ollama、ComfyUI 和 LM Studio 等主流框架,并为 Linux 提供 ROCm 优化;得益 x86,标准环境编译的应用原生运行,无需 ARM 模拟。AMD 还与 Hugging Face 深化合作,每台锐龙 AI Halo 附赠一年 Pro 订阅,ROCm 软件栈能横跨不同硬件平台。
价格是一道分水岭。TheOutpost.AI 援引 Framework 信息称,现款 128GB 版(Ryzen AI Max+ 395)定价已从 2025 年 2 月首发时的 1999 美元涨到 3449 美元,受内存涨价影响,192GB 版零售价可能突破 4500 美元;而英伟达 DGX Spark(128GB)售价接近 5000 美元。

五、热闹背后的三道坎
第一道坎是供应链。k.sina 发出警示:受 AI 基础设施需求激增影响,2026 年全球 DRAM 短缺加剧,LPDDR 合约价格同比上涨约 146%。苹果此前因内存模块供应限制取消高配 Mac Studio 配置,正是缺了 AMD 192GB 配置所需的关键 24GB LPDDR5X 封装。192GB 配置的具体定价和可用性仍存变数,潜在买家需密切关注 OEM 公告。
第二道坎是真实性能尚未经过独立验证。CPU News 和 k.sina 都强调,300B 参数宣称基于 4 位量化、约 150GB VRAM 的前提,且目前尚无量产硬件的独立基准测试,实际吞吐量要等系统发货后才能验证;模型量化方式、工作负载类型与软件优化程度,都会显著影响体验。
第三道坎是需求错配。AMD 把智能体描述为「下一个生产力工具」,称单一个人体智能体可带来两倍生产力,多重能力智能体团队协作理论上可达 100 倍效能提升——但这些数字属于 AMD 对应用潜力的描述,实际效益取决于工作流。对大多数个人用户,70B 级别本地模型已够用;300B 本地跑的真正买主,是重视数据隐私、离线可靠、想省下云端 Token 费用的企业与开发者。
真正的考验,是这台机器能不能从「能跑」走到「常用」。
AMD 用 192GB 统一内存证明了一件事:大模型不必永远住在大机房里。但当 DRAM 涨价、实测未出、需求仍小众,把这台电脑放进普通人书房的路,还很长。到那时,答案才会真正浮出水面。
