本地运行35B大模型引发DDR4内存报错,硬件损坏尚无定论

发布时间:2026-10-03 05:01  点击:1次
本地运行35B大模型引发DDR4内存报错,硬件损坏尚无定论

一名用户在本地工作站运行参数量约350亿的 Ornith-1.5-35B-A3B 大语言模型(LLM)期间,多次遭遇 DDR4-ECC 内存报错。高负载引发了系统崩溃与错误记录,但现有数据尚不足以证明是 AI 模型直接导致了物理内存损坏。

涉事设备为一台 2019 年款的联想 ThinkStation P920 工作站,搭载双路至强处理器、显存为 16 GiB 的 GeForce RTX 5070 Ti 显卡以及总计 128 GiB 的 DDR4-ECC 内存(由 16 条 8 GiB 模块组成)。据用户反馈,此前运行参数量在 200 亿左右的小型模型时,因模型可完整或大部分载入显卡显存,半年内未出现此类问题。

更换为 Ornith-1.5-35B-A3B 模型后,由于该混合专家(MoE)架构模型总参数量约 350 亿,且单次推理仅激活约 30 亿参数,其体积超出了显卡 16 GiB 显存的承载上限。部分计算任务被迫卸载至系统内存,导致 DDR4 内存的实际读写负荷显著增加。

在高负载运行约 90 分钟后,工作站首次发生崩溃并记录到内存错误。移除报错的 Slot 8 内存条后任务恢复,但在后续连续使用数天后,另一条内存模块也出现了 ECC 错误累积现象。

ECC 机制仅能表明内存传输路径中检测到了数据校验失败,并不能直接推导为芯片性损伤。持续且高强度的内存读写压力更有可能放大了该批次内存条本身已存在的潜在缺陷。在未经过单条 DIMM、插槽及其他主板组件的详细交叉测试前,无法准确判定故障根源。

深圳市龙岗区鑫万疆再生资源商行

联系人:
王生(先生)
电话:
19146466062
手机:
19146466062
地址:
全国地区回收电子元器件IC芯片
我们发布的其他电子元件/电子配件新闻更多
19146466062 请卖家联系我