外接4060掉链:2026-10-04 完整实验台账(单调变量逐项)

2026-10-04 全天排查的逐项实验台账。原则:同时只改一个变量;每次实验都挂记录仪(遥测 500ms + 功率 2.5s);用 monkey 压测(随机窗口/显示模式切换/NVENC 渲染各带毫秒时间戳)作为加速器;掉链即停并保留最后一条好数据。

🔧 硬件变量实验(每行独立,每行一个变量)

序变量结果结论
H01把 4060 的 DP 线从第一根换成第二根(DP2.0)仍掉(93 分钟时)❌ DP 线不是元凶
H02断开菊花链第二台显示器,只留单屏仍掉(14分24秒)❌ 菊花链/MST 不是必要条件
H03重新组装显卡坞、确认线材与电源仍掉(61 分钟后)❌ 重装不是修复
H04OCuLink 线重新走线,消除很窄的 U 型急弯、不再受压仍掉(17分21秒)❌ 走线/应力不是元凶
H05外部电源线压死插到位(之前差一小截未完全插入)仍掉(17分21秒)❌ 外电源接触不是元凶
H06换用★全新 OCuLink 数据线 + ★全新外部电源线仍掉(14分24秒)❌ 线材全部排除
H07DP 线位置互换:第二根作前置、第一根作后置(菊花链)仍掉❌ 线位不是变量
H08★ 坞内【驱动板→4060】供电线:带滤波 → 普通 1分2 8pinmonkey 3000 轮完整跑完,2小时8分31秒零掉链✅ 唯一改变结果的一步

🔍 软件与配置审计(每行独立)

序项结果
S01两块显卡驱动升级到最新(4060 → 617.14 / 780M 保持 32.0.31041.3013)升级成功,但掉链照旧 → ❌ 与驱动版本无关
S02NVIDIA 参数审计(功耗墙/频率/全部 throttle reasons)115W=默认、区间 90/138、所有 throttle Not Active(功耗墙累计 0.31 秒)→ 无被改坏的参数
S03死链前死因审计:`RmDisableInst2Sys=1`、`RmFbsrPagedDMA=1`、HAGS `HwSchMode=2`均为已知 eGPU 补丁/Windows 默认项,无异常
S04TDR 注册表项(TdrDelay/TdrLevel/TdrDdiDelay)均不存在 → 保持驱动默认
S05PowerMizer / NvCplApi Policies / HKCU 策略键均不存在 → 电源管理未被手改、无策略锁
S06PCIe 链接状态电源管理(ASPM)AC = 关闭,DC = 中等省电 → OS 层 ASPM 已关,排除该开关
S07NVIDIA 控制面板设置库文件时间戳= 开机时刻(驱动每次启动重写)→ 不能作为「最近改过设置」的证据
S08中断/MSI 设置4060 `MSISupported=1`、★`MessageNumberLimit=1`(NVIDIA/AMD 的 INF 都没写这两项);用户裁定不改动该参数
S09关 ReBAR只治好另一个问题(开机微端口启动失败 `0xC000009A`),对掉链无效 → 保持关闭,不要改回
S10系统睡眠/Modern Standby本机仅支持 S0(S1/S2/S3 固件不支持);曾发现长待机后当天开始连环掉链的时间相关性

⚡ 压测实验(monkey,每行独立)

轮时间配置存活压测量死亡形态
M119:37第二根 DP 线单屏27 分(整机 93 分)60 轮 / 20 切换 / 30 编码monkey 结束后 10 秒
M219:56第一+第三根 DP 菊花链 2 台13 分 57 秒267 轮 / 44 切换 / 88 编码编码任务中
M320:50第一根 DP 单屏 + OCuLink 重走线 + 电源压死17 分 21 秒451 轮 / 63 切换 / 125 编码`/internal` 后 4 秒
M421:29全新 OCuLink 线 + 全新电源线,菊花链 2 台14 分 24 秒373 轮 / 53 切换 / 105 编码`/internal` 后 2 秒
M522:14★ 坞内供电线换普通 1分2 8pin2 小时 8 分 31 秒,3000 轮完整跑完500 切换 / 1000 编码全部完成零掉链

💥 死亡形态的收敛(四次普爆都指向同一个瞬态)

轮最后致命动作距死亡死前频率死前 PCIe
M1`/extend`(脚本收尾切换)10 秒——
M2编码任务中(死前 3 秒链路刚 gen1→gen4 重训)—2505 MHzgen4 x4
M3`/internal` + 立即渲染4 秒2595 → ★585 MHzgen2 x4
M4`/internal` + 立即渲染2 秒2505 → ★240 MHzgen1 x4

⇒ 共性:死亡都发生在“显示输出被拆除 → 再被唤醒重建显示/渲染状态”这个瞬态里,且死前总是伴随一次频率断崖(电流阶跃)。

🎯 决定性实验(枪管内供电线的 A/B)

配置同一套压测序列的结果
旧【带滤波】供电线最近三轮连续普爆:13分57秒 / 17分21秒 / 14分24秒
新【普通 1分2 8pin】供电线500 次显示切换 + 1000 次编码 + 链路切速 6200+ 次采样:零掉链

⇒ 「显示切换+立即渲染」不是普适触发器,而是「该序列 + 某个硬件条件」的组合,而两次之间唯一差别就是那根供电线。用户据此判定为【带滤波的 8pin 供电线老化】。

📄 当日 WATCHDOG 转储清单(每个文件独立一行)

#文件大小(字节)bugcheck类型
1WATCHDOG-20261004-0936.dmp1,645,7430x117 VIDEO_TDR_TIMEOUT真掉链
2WATCHDOG-20261004-0949.dmp1,092,5820x141 VIDEO_ENGINE_TIMEOUT真掉链
3WATCHDOG-20261004-1058.dmp1,115,2400x141 VIDEO_ENGINE_TIMEOUT真掉链
4WATCHDOG-20261004-1059.dmp276,7550x1B0非掉链(驱动/链路看门狗)
5WATCHDOG-20261004-1257.dmp281,3290x1B0非掉链
6WATCHDOG-20261004-1331.dmp1,117,1790x141 VIDEO_ENGINE_TIMEOUT真掉链
7WATCHDOG-20261004-1433.dmp1,236,4510x141 VIDEO_ENGINE_TIMEOUT真掉链(采到完整临死遥测)
8WATCHDOG-20261004-1544.dmp1,165,1450x141 VIDEO_ENGINE_TIMEOUT真掉链
9WATCHDOG-20261004-1637.dmp281,0090x1B0非掉链(装驱动时)
10WATCHDOG-20261004-1751.dmp1,126,7650x141 VIDEO_ENGINE_TIMEOUT真掉链
11WATCHDOG-20261004-1941.dmp1,304,0680x141 VIDEO_ENGINE_TIMEOUT真掉链(M1 那轮)
12WATCHDOG-20261004-2010.dmp1,085,2840x141 VIDEO_ENGINE_TIMEOUT真掉链(M2 那轮)
13WATCHDOG-20261004-2018.dmp276,0510x1B0非掉链
14WATCHDOG-20261004-2025.dmp281,1050x193非掉链(dxgkrnl 实时转储)
15WATCHDOG-20261004-2107.dmp1,001,1660x141 VIDEO_ENGINE_TIMEOUT真掉链(M3 那轮)
16WATCHDOG-20261004-2120.dmp676,7280x141 VIDEO_ENGINE_TIMEOUT真掉链(前一状态余波)
17WATCHDOG-20261004-2143.dmp1,052,6900x141 VIDEO_ENGINE_TIMEOUT真掉链(M4 那轮)

合计:真掉链 12 次(0x141 ×11 + 0x117 ×1)、非掉链类 5 次,共 17 个转储。

🧰 当日使用的工具(均位于 Hermes profile 的 scratch 目录)

脚本用途
egpu-trace.ps1遥测记录仪,500ms,字段自发现(温度/频率/占用/显存/风扇/PCIe gen+width+replay/throttle/pstate),失联即停并保留最后一条好数据
egpu-power.ps1功率记录仪,2.5s 采 nvidia-smi 的 Power 字段(★已证为假值,仅留档)
egpu-monkey.ps1随机窗口/显示模式/NVENC 渲染压测,带毫秒时间戳,掉链即停
egpu-trigger.ps1快速触发器:循环「显示模式切换 → 立即渲染」,分钟级判决
egpu-postreboot.ps1重启后一键拉起检查(卡状态/链路/显示器归属/屏幕数/ASPM/转储清单)
egpu-settings-audit.ps14060 只读参数审计(11 个节,全量)

取证归档:savedata\egpu-forensics\(72 文件 / 6.3 MB,含全部轮次的遥测、功率、monkey、脚本、审计报告)