24小時服務熱(rè)線:17328677649
工控天地
服務熱線 17328677649

工控文章

當前位置:首頁 工控天地 工控文章
Antminer S19 XP Hyd./S19 XP+ Hyd. 水冷礦機高溫(wēn)停機與電(diàn)源版本讀取失敗的係統診斷方法
發(fā)布時間:2026-07-10 15:35:06 | 瀏覽量:1

Antminer S19 XP Hyd./S19 XP+ Hyd. 水冷礦(kuàng)機高溫停機與電源版本讀取失敗的係統診斷方法

引言

在大規模水冷礦場中,Antminer S19 XP Hyd.、S19 XP+ Hyd. 等液冷礦(kuàng)機經常以多(duō)機並聯方式運(yùn)行。與傳統風冷礦機(jī)相(xiàng)比,水冷(lěng)礦機取消了高速散熱風扇,依靠循環冷卻液、冷板、換熱器、水泵(bèng)和外部散熱係統帶走芯片產生的熱量。

這種結構能夠降(jiàng)低噪聲、提高功率密度,並改善高溫環境下(xià)的運行穩定性,但同時也引入了更複(fù)雜的故障鏈路。礦機不再隻依賴環境(jìng)溫度和風扇轉速判斷散熱狀態,而是綜(zōng)合監控算力板溫度、PIC控製器溫度、冷卻液(yè)狀態、電源通信、芯片(piàn)識別結果和升頻(pín)過程(chéng)。

因此,當礦機日(rì)誌同時出現以下信息時(shí),現場維修人員很容易誤判:

get power version failed
check power version failed, use v2 protocol to try it again
ERROR_TEMP_TOO_HIGH
over max temp
power off hashboard

有(yǒu)些(xiē)維(wéi)修人員看到“get power version failed”便直接判斷電源損壞;另一些人員看到“ERROR_TEMP_TOO_HIGH”則隻檢查室溫,發現環境溫度(dù)僅為32~33℃後,便懷疑溫度檢測係統失靈(líng)。

實際上,這兩類日誌可能同時存在(zài),但其嚴重程度、因果關係和維修優先(xiān)級並(bìng)不相同。正確的診斷方法不是抓住某一條日誌單獨判斷,而是按照礦機完整啟動順序,對控製板、算力板、電源和水冷係統進行分(fèn)層(céng)分(fèn)析。

本文以多台Antminer S19 XP Hyd.和S19 XP+ Hyd.現場運行案例為基(jī)礎,係統介紹水冷礦機高溫停機、電源版本讀取失敗、算力板EEPROM版本提示異常、升頻中斷(duàn)等問題的判斷邏輯和(hé)排查方法。

1.jpg


一(yī)、水冷(lěng)礦機的基本係統結構

一台完整的Antminer S19 XP Hyd.或S19 XP+ Hyd.通常由以下部(bù)分組成:

  1. 控製板;

  2. 三塊水冷算力板;

  3. 礦機專用電源;

  4. 算(suàn)力板供電(diàn)銅排或(huò)高電流連接結構;

  5. 電源通信線路;

  6. 算力板數據排線;

  7. 冷卻液分(fèn)配(pèi)器;

  8. 冷板及內(nèi)部流道;

  9. 進水和回(huí)水軟管;

  10. 外部循環泵(bèng);

  11. 換熱(rè)器或冷卻(què)塔;

  12. 流量、壓力(lì)和溫度檢測裝置。

控製板負責啟動Linux係統、讀取(qǔ)算力板EEPROM、識別ASIC芯片、與電源通信、設定工作電壓和頻率,並持續監控溫度。

算力板由大量(liàng)ASIC芯片組成。S19 XP Hyd.和S19 XP+ Hyd.不同版本的芯片數量、頻率和額(é)定算力不同,但多塊板共同工作的基本邏輯一(yī)致。

礦機電源並(bìng)非單純輸出固定直流電壓。控製板會通過(guò)通信接口讀取電源版本、序列號、校準數據和(hé)運行狀態,並根據當前工作頻率動態調整輸出電壓(yā)。

水冷係(xì)統則(zé)負責將(jiāng)ASIC芯片(piàn)、板上電源器件和控製器件產生(shēng)的熱量傳遞到冷卻(què)液中,再由外部散熱設備排出。

任何一個環節異常,都可能(néng)導致(zhì)礦機(jī)啟動失敗或運行中(zhōng)停機。

2.jpg


二、為什麽環(huán)境溫(wēn)度正常,礦機仍然會報高溫

現場(chǎng)最常見的誤區,是(shì)把礦機日誌中的“溫度過高”理解為“機房空氣溫度過高”。

對於水冷礦機而言(yán),環(huán)境溫度(dù)隻是影響散熱的一個外(wài)部因素。礦機保護(hù)程序真正關注的,是內部采集(jí)到的溫度數據。

例如,現場環(huán)境溫度可能隻有32℃,冷卻液入口溫度也可能接近30℃,但某塊算力板仍然可能升至(zhì)80℃以(yǐ)上。

這是因為芯(xīn)片產生的熱量需要經過完整的熱傳遞路徑:

ASIC芯片結溫
→ 芯片封裝
→ 導熱材(cái)料
→ 水冷板
→ 冷卻(què)液
→ 管路
→ 換熱器
→ 外部環境

隻要其中任何(hé)一段熱阻異常,芯(xīn)片或板上溫度就會快速升高。

常見原因包括:

  • 某塊冷板內部堵塞;

  • 水路中存(cún)在氣阻(zǔ);

  • 軟管折彎或壓(yā)扁;

  • 快速接頭未完全打(dǎ)開;

  • 分水器(qì)分配不(bú)均;

  • 冷卻泵流(liú)量不足;

  • 冷卻液黏度過高;

  • 冷(lěng)卻(què)液內存在沉積(jī)物;

  • 冷(lěng)板內(nèi)部結垢;

  • 芯片和冷板接觸不良;

  • 導熱材料老化;

  • 溫度傳感器偏移;

  • 板上PIC或溫度采集電路異常。

所以,環境溫度(dù)低並不能證明礦機內部(bù)溫度正常。


3.jpg

三、礦機啟動日誌的(de)正確閱讀順序

維修Antminer水冷礦機時,不應隻截取(qǔ)最後一條錯誤信息,而應完整觀察從上電到停機的全過程。

通(tōng)常可以將啟(qǐ)動過程劃分為七個階段。

第一階段:控製板係統啟動

日(rì)誌中會(huì)出現Linux內核、存儲設備、網絡接口和文件係統信息,例如:

UBIFS mounted
eth0: link becomes ready
start the http server
httpserver:6060 started ok

這一(yī)階段(duàn)若成功(gōng),說明控製板能夠正常啟動,網絡接口和Web管理頁麵(miàn)基本正常。

如果Web頁麵能夠訪問(wèn),通常說明控(kòng)製板主處理器、存(cún)儲(chǔ)器和(hé)網絡(luò)係統沒有嚴重故障。


第二階段:識別礦機型號和算力板數量

典型日誌為(wéi):

board num = 3
board id = 0, chain num = 1
board id = 1, chain num = 1
board id = 2, chain num = 1
chain num = 3

這表示控製板識別到三塊算力板。

如果隻顯(xiǎn)示一(yī)塊或兩塊,則可能存在:

  • 算力板排線故障;

  • 控製板接口故障;

  • 算力板輔助電源異常;

  • 算力板PIC未啟動;

  • 某(mǒu)塊板嚴重短路(lù);

  • 固件與硬件不兼容。

如果三塊板都被識(shí)別,則說明基本通信鏈路已經建立,但不能因此完全排除(chú)算力板故障。


第三階段:讀取(qǔ)算力板EEPROM數據

日誌可能出現:

load chain 0 eeprom data
version invalid 5!=4
v5 load data succ

這類信息經常(cháng)被誤認為(wéi)算力板EEPROM損壞(huài)。

實際上,必須結合後續日誌判斷。

如(rú)果程序先提示:

version invalid 5!=4

隨後又顯示:

v5 load data succ

通常表示當前程序先按某(mǒu)一舊版本格式讀取數據,發現版本號不一致後(hòu),又按照新版本格式重新讀取(qǔ),並成(chéng)功獲取數據。

因(yīn)此,單獨出現“version invalid 5!=4”並不(bú)一定構成致命故障。

隻有出現以下情況時,才更值得懷疑EEPROM問題:

eeprom read failed
crc error
invalid board data
cannot load eeprom
chain data missing

或者礦機無法識別(bié)正確型號、頻率、電壓、芯片數量時,才需要進一(yī)步(bù)檢查EEPROM。


第四階段(duàn):識別ASIC芯片

正常日誌可能為:

Chain[0]: find 204 asic
Chain[1]: find 204 asic
Chain[2]: find 204 asic

如果三條鏈都能識別完(wán)整芯片數量,說明以(yǐ)下部分基本正常:

  • 控製板到算力板的數據通信;

  • 算力板時(shí)鍾鏈路;

  • 複位鏈路;

  • ASIC串(chuàn)行通信鏈;

  • 算力板PIC基本工作;

  • 大部分芯片未出現嚴重斷鏈。

這(zhè)並不代(dài)表算力(lì)板完全沒有故障,但至(zhì)少說(shuō)明不是典型的“掉芯(xīn)片”“少芯片”或信號鏈斷裂問題(tí)。

如果某塊板(bǎn)隻(zhī)能找到部分ASIC,則(zé)應重點檢(jiǎn)查:

  • 該鏈中(zhōng)斷位置;

  • 時(shí)鍾信號;

  • 複位信號;

  • CO、RI、BO信號;

  • 局部供電;

  • 壞芯片;

  • 焊接問題。


第五階段:與礦機電源(yuán)通信(xìn)

日誌可能出現:

get power version failed
check power version failed, use v2 protocol to try it again
power open power_version = 0x65
power is calibrated
power sn: XXXXX
enable_power_calibration

這一段必須整(zhěng)體理解。

第一條:

get power version failed

表示控製板第一次嚐(cháng)試讀(dú)取電源版本失敗。

第二條:

use v2 protocol to try it again

說明程(chéng)序準備改用另一種通信協議重試(shì)。

之後如果又出現(xiàn):

power open power_version = 0x65
power is calibrated
power sn: XXXXX

則表明控製板(bǎn)最終仍然讀取到了電(diàn)源部分信息,包(bāo)括(kuò):

  • 電源版本;

  • 電源(yuán)序列號;

  • 校準狀態;

  • 校準數(shù)據(jù)。

這時不能簡(jiǎn)單認定電源完全損壞。

更合(hé)理的判斷是:

  • 第一次通信握手失敗;

  • 程序與電源通信(xìn)協(xié)議存在版本差異;

  • 通信有間(jiān)歇性幹擾;

  • 固件兼容性不(bú)理想;

  • 通(tōng)信線接觸不良;

  • 電源響應(yīng)較慢;

  • 電(diàn)源控製器(qì)啟動時序異常。

隻有當後續無法讀取任何電源數據(jù)、無法調整輸出電(diàn)壓、算力板完全不上電,或者不斷(duàn)出現通信(xìn)超時(shí),才應高(gāo)度懷疑電(diàn)源本(běn)體或通信電路故(gù)障。


第六階段:電(diàn)壓建立與(yǔ)逐級升頻

正常情況下,礦機會先建立(lì)較低電壓和低頻,然後逐步提升(shēng)頻(pín)率,例如:

set_voltage_by_steps to 2100
Chain[0]: find 204 asic
Chain[1]: find 204 asic
Chain[2]: find 204 asic
chain 0 set freq to 50
chain 1 set freq to 50
chain 2 set freq to 50
...
chain 0 set freq to 475
chain 1 set freq to 475
chain 2 set freq to 475

逐級升頻的(de)目的是避免算力板瞬間承受高電流衝擊,並在升頻過程中檢測:

  • ASIC穩定(dìng)性;

  • 電壓是否滿足要求;

  • 溫度是否異常;

  • 芯片是否(fǒu)掉線;

  • 板上通信是否穩定。

如果礦機能夠從50MHz逐步升(shēng)至475MHz,說明:

  1. 電源已經實際向算力板供電;

  2. 控製板能夠調節工作電壓;

  3. ASIC能夠響應頻率調整;

  4. 三塊板至少在升頻階段具備(bèi)工作能力。

因此,如果“get power version failed”之後礦機仍然能正常升頻,說明該錯誤不(bú)一定是本次停機的直(zhí)接原因。


第七階(jiē)段:溫度保(bǎo)護或其他保護觸發

典型高溫日誌為:

over max temp, pic temp(chain2) 81 (max 80)
ERROR_TEMP_TOO_HIGH
stop mining: over max temp
power off hashboard

這才是本次停機的直接觸發原因。

日(rì)誌明(míng)確說明:

  • Chain 2溫(wēn)度為81℃;

  • 允許最大值為80℃;

  • 控製程序觸發高溫保(bǎo)護;

  • 礦機(jī)停止挖(wā)礦;

  • 算力板被(bèi)斷電。

因此(cǐ),維(wéi)修時應區分“伴(bàn)隨信息”和“最(zuì)終停機原因(yīn)”。

“get power version failed”可(kě)能是啟動過(guò)程中一次通信重試,而“ERROR_TEMP_TOO_HIGH”才是導致礦機停機的最終事件。


四、案例中(zhōng)的(de)關鍵故障(zhàng)特征(zhēng)

在多台S19 XP Hyd.和S19 XP+ Hyd.現場案(àn)例中,可以觀(guān)察到以下現象:

  • 部分礦機正常運行,算力達到259TH/s、298TH/s或303TH/s;

  • 部分礦機算力為0;

  • 某些停機設備顯示溫度範圍(wéi)48~96℃;

  • 某些設備顯示0~32℃;

  • 多台設備日誌出現相似的EEPROM版本(běn)提示;

  • 多台設備出現電源版本第(dì)一次讀取(qǔ)失敗;

  • 某台(tái)設備在升頻至475MHz後出(chū)現81℃高溫保護;

  • 另一台(tái)設備出(chū)現電(diàn)源校準文件(jiàn)讀取異常並重啟;

  • 水冷機組采用多台礦機集中管路和集中供電。

這些特征說明,現場並非隻有一個單一故障(zhàng)。

至少可能同時存在三類問題:

  1. 個別礦機水路或冷(lěng)板(bǎn)散(sàn)熱(rè)異常;

  2. 部分礦機固件版本不一致;

  3. 個別礦機電(diàn)源校準文件或(huò)通信過程異常。

維修時必須按設備IP地址分別(bié)分析,不能因為設備(bèi)型號相同,就把所有礦機歸為同一個故障(zhàng)。


五、如何判斷是真高溫還是假高溫

礦機報高溫後,應先判斷(duàn)溫度是否(fǒu)真實。

1. 觀察溫度變化速度(dù)

如果礦機從低溫啟動後(hòu),溫度在幾十秒內快速由30℃升至80℃以上,常見原因包括:

  • 對應板水路(lù)無流量;

  • 冷板內部堵塞;

  • 進出水(shuǐ)管(guǎn)閥門關閉;

  • 水管折(shé)彎;

  • 接頭未打開;

  • 板內存在大量空氣;

  • 溫度傳感器異(yì)常。

如果溫度在數分鍾內緩慢升高,則更可能是:

  • 總流量不足;

  • 冷卻液入口溫度過(guò)高;

  • 換熱器散熱(rè)能力不足;

  • 水泵轉速低;

  • 多機並聯後流量分配(pèi)不(bú)均。


2. 比較三塊算力板溫度

三(sān)塊板在相同運行條件下,溫度一般不會相差過大。

如果顯示為:

Chain 0:55℃
Chain 1:57℃
Chain 2:81℃

則基本可以判(pàn)斷Chain 2存在局部問題。

若三塊板都同時達到高溫,則應(yīng)檢查總水路和外部(bù)換熱(rè)係統。


3. 測量進出水管溫度

可以使用紅外測溫儀、接觸式溫度(dù)探頭或熱成像儀,分別測量:

  • 總進水溫(wēn)度;

  • 總回水溫度;

  • 每台礦機進水(shuǐ)溫度;

  • 每(měi)台礦機回水溫(wēn)度;

  • 每塊(kuài)板對應管路溫度。

需要注意,紅外測溫儀直接測透明或半透明軟管時誤差較大。建議在管路表(biǎo)麵貼黑色膠(jiāo)帶後再測量。

判斷原則如下:

進出水(shuǐ)幾乎沒有溫差,板溫卻很高

可能(néng)原因:

  • 水沒有真(zhēn)正流過冷(lěng)板(bǎn);

  • 管路旁通;

  • 接頭未打(dǎ)開;

  • 內部堵塞(sāi);

  • 溫度傳感器異常。

進出水溫差過大

可(kě)能原因:

  • 流量不足;

  • 冷板阻力過大;

  • 管路堵塞;

  • 泵壓不足。

所有礦機進水溫(wēn)度都高

可能原因:

  • 換熱器能力不足;

  • 環境散熱條件差;

  • 冷卻塔故障;

  • 水泵循(xún)環不正常;

  • 係統熱負荷超過設計值(zhí)。


4. 交(jiāo)換法(fǎ)驗證

交換(huàn)法是現場最有效的故障(zhàng)隔離方法之一。

可以在斷電並確認無壓力後,將故障礦機某一路水管與正常礦機對應水管進行對換。

需要觀察故(gù)障是否發生轉移。

如果故(gù)障跟隨水路移動

說明問題更可能在:

  • 分(fèn)水器(qì);

  • 軟管;

  • 快速接頭;

  • 閥門;

  • 對應支路流量。

如果故障始終停留在同一塊算力(lì)板

說(shuō)明(míng)問題更可能在(zài):

  • 算力板冷板;

  • 板內流道;

  • 溫度傳感器;

  • PIC采集電路;

  • 導熱接觸結構(gòu)。

交換測試必須在完全斷電、降壓和冷卻液停止循環後進行,避免帶壓拆管造成冷卻液噴出(chū)。


六、Chain 2高溫的(de)可能原因分析

原因一:冷板內部堵(dǔ)塞

水冷礦機長(zhǎng)期運行後,冷卻(què)液中可能出現:

  • 金屬氧(yǎng)化物;

  • 雜質;

  • 密封材料碎屑;

  • 水垢;

  • 腐(fǔ)蝕沉積物;

  • 微生物(wù)汙染(rǎn)物。

這些(xiē)物質會逐漸堵塞冷板內(nèi)部細小流道(dào)。

冷板外觀可能完全正常(cháng),但實際流量已明顯下降。

判斷方法:

  • 比較該板進出水溫差;

  • 測量支路流(liú)量;

  • 拆下後進行低(dī)壓通(tōng)水測試;

  • 比較(jiào)正常板和故障板的水阻。

嚴禁直(zhí)接使用(yòng)高壓氣(qì)體衝擊(jī)冷板,以免損傷密封結構。


原因二(èr):氣阻(zǔ)

水路中殘留空氣時,可能在冷板高點形(xíng)成氣囊(náng)。

氣體(tǐ)的導熱能力遠低於冷卻液,同時會阻礙液(yè)體流動。

表現為:

  • 軟管內可見氣(qì)泡;

  • 水流聲不穩定;

  • 溫度突然波動;

  • 啟動後某塊板快速升溫;

  • 停機後溫度又迅速下(xià)降。

解(jiě)決方法包括(kuò):

  • 進行係統排氣;

  • 調整管路高低位置;

  • 檢查膨脹(zhàng)罐液位;

  • 增加自動排氣閥;

  • 避免進水(shuǐ)管吸入空氣。


原因三:快速(sù)接頭未完全開啟

許多液冷係統使用自封式快速接頭。

接頭插入(rù)不到位時,外觀看似已經連接,但內部閥芯並未完全打(dǎ)開。

這種情況(kuàng)下可能仍有少量液體通過,卻不足以滿足高負載散熱要求。

礦機低頻(pín)時可能正常,一旦升頻到400MHz以上(shàng),溫度便迅速上升並觸發保護。


原因四:軟管彎折或壓扁

現(xiàn)場水管排列複雜(zá),多台(tái)礦機緊密安裝時(shí),軟管容易出現:

  • 小半徑彎折;

  • 被機架壓住;

  • 與相鄰軟管(guǎn)纏繞;

  • 長期高溫後軟化塌陷。

任何局部截麵積減小都會顯著降低流量。

檢查時(shí)不能隻看接頭,還應檢(jiǎn)查整(zhěng)段軟(ruǎn)管。


原因五:分水器流量不平衡

多台礦機共用一套循(xún)環係統時,流體會優(yōu)先流向阻力較小的支路。

距離水泵(bèng)近、管路短、阻力小的礦機可(kě)能獲(huò)得較大(dà)流量,而遠端或阻力較大的礦機(jī)流量不足。

這種問(wèn)題往往表現為:

  • 部分礦機長(zhǎng)期穩定(dìng);

  • 部分礦機頻繁高溫;

  • 高溫設備集中在(zài)同一位置;

  • 調高泵速後故障減輕;

  • 關閉部分正常設備後,故障設備恢複。

需要通(tōng)過平(píng)衡閥、流量計或合理的同程(chéng)管路設計進行調整。


原因六(liù):導(dǎo)熱接觸不良

即使冷卻液流量正常(cháng),ASIC芯片到冷板之間(jiān)的熱傳導也可能異常。

例如:

  • 導熱墊老(lǎo)化;

  • 導熱材料厚度不合適;

  • 冷板壓力不(bú)足;

  • 冷板變形;

  • 固定螺釘鬆(sōng)動;

  • 板麵翹曲;

  • 局部汙染。

此時冷卻液溫度可能不高,但芯(xīn)片或板(bǎn)上溫度(dù)明顯升高。

這種故障通常需(xū)要拆機檢查,不建議現(xiàn)場未經培訓人員(yuán)自行拆(chāi)冷板。


原因七:溫度傳(chuán)感器或PIC采集異常

如果實際管路溫度、板麵溫度和正常設備接近,但日(rì)誌仍固定顯示80℃以上,則可能存在:

  • 溫度傳感器偏移;

  • 傳(chuán)感器開路或(huò)短(duǎn)路;

  • 采樣電阻異常;

  • ADC參考電壓異常;

  • PIC固件異常;

  • 算力板局部供電異常。

可以通(tōng)過交換算(suàn)力板、讀取不同固件(jiàn)日誌或進行(háng)板級測量(liàng)驗證。


七、“get power version failed”到底意味著什麽

電源版(bǎn)本讀(dú)取失敗(bài)不能一概而論(lùn)。

情況一:僅首次讀取失敗,後續成功

日誌表現(xiàn):

get power version failed
use v2 protocol to try it again
power open power_version = 0x65
power is calibrated
power sn: XXXXX

這種情況(kuàng)下,電源通(tōng)信並未完全中斷。

礦機後續能夠:

  • 建立輸出電壓;

  • 識別(bié)ASIC;

  • 逐級升頻;

  • 進入運行階段。

那麽“get power version failed”更像兼容性或通信重試提示。

此時(shí)應先處理真正導致停機的錯誤。


情(qíng)況二:持續無法獲取電源信息

如果日誌反複出現:

get power version failed
power communication timeout
cannot read power SN
power init failed

並且(qiě)算力板(bǎn)無電(diàn)壓或無法啟動,則需要檢查:

  • 電源通信線;

  • 接口針腳;

  • 電源輔助供電;

  • 控製板通信端口;

  • 電源(yuán)內部MCU;

  • 固件和電源型號兼容性。


情況三:電(diàn)源校準文件讀取失敗

某(mǒu)些日誌可能出現:

fail to open counter file
No such file or directory
ERROR_INIT
something error when miner init

如(rú)果該錯誤出(chū)現在電源校準或啟動(dòng)參數讀取階段,並導致礦機直接重啟,則(zé)可能涉及:

  • 控製(zhì)板文件係(xì)統缺(quē)少參數文件;

  • 固件包不完整;

  • 配置分區損壞;

  • 升級後數據未正確生成;

  • 電源校準數據無法加載。

這種情況與單純高溫停機不同,需要單獨處理(lǐ)。

解決(jué)思路包括:

  1. 備份礦池和網(wǎng)絡參數;

  2. 恢複出廠設置(zhì);

  3. 刷入準確型號的官方固件;

  4. 確(què)認固件對應S19 XP Hyd.或S19 XP+ Hyd.;

  5. 冷啟動後重新觀察日誌;

  6. 必要時更換控製板交叉測試。


八、固件混用帶來的風險

現場多(duō)台礦機如(rú)果(guǒ)使用不同年份、不同型號或不同編(biān)譯版本(běn)的(de)固(gù)件,會增加診(zhěn)斷難度。

S19 XP Hyd.與S19 XP+ Hyd.雖然結構相近,但不(bú)能隨(suí)意互刷。

錯誤固件(jiàn)可能導致:

  • 電源(yuán)通信協(xié)議不匹配;

  • 算力板EEPROM格式識別異常;

  • 頻率參數錯誤;

  • 溫度(dù)閾值錯誤;

  • 芯片數量識別錯誤;

  • 電壓曲線不匹配(pèi);

  • 功率校準失敗;

  • 自動重啟。

因此,刷固件前必須確認:

  • 機器銘牌型號;

  • 額(é)定算力;

  • 控製板類型;

  • 電(diàn)源型號;

  • 當前固件版本;

  • 官方(fāng)固(gù)件適用範圍。

不要因為兩台礦機(jī)外觀相同,就默認固件可以互換。


九(jiǔ)、推薦的標準排查流程

第一步:記錄設備信息

至少記錄:

  • IP地址(zhǐ);

  • 礦(kuàng)機型號;

  • 序列號;

  • 固件版本;

  • 當前算力;

  • 三(sān)塊板溫度;

  • 停機時間;

  • 日誌最後50~100行。

多台設備同時故障時,應分別建立記錄,避免(miǎn)混淆(xiáo)。


第二(èr)步:確認最終停機原因

在日(rì)誌末尾尋找(zhǎo):

ERROR_TEMP_TOO_HIGH
ERROR_POWER
ERROR_SOC_INIT
ERROR_FAN
ERROR_ASIC
power off hashboard
stop mining

最後(hòu)出現的保護信息通常最有(yǒu)價值。


第三步:確認三塊算力板和ASIC數量(liàng)

如果三塊板和全部ASIC均識別正常,則先不要拆板維修。

應繼續檢查升頻過程和最終保護原因。


第四步:檢查水冷係統

包括:

  • 水泵是否運(yùn)行;

  • 總流量是否達標;

  • 進水溫度;

  • 回水溫度;

  • 係統壓力;

  • 冷卻液液位;

  • 是否(fǒu)有氣泡;

  • 快速接頭是(shì)否到位;

  • 軟管是否彎折;

  • 閥門是否完全打開(kāi)。


第五步:比較正常機與故障機

同一(yī)現場有正常機器時,應充分利用對比條件。

比較:

  • 固件(jiàn)版本;

  • 電源型號;

  • 啟動日誌;

  • ASIC數量;

  • 升頻時間;

  • 進出水溫差;

  • 運行(háng)溫度;

  • 電源(yuán)通信信息。

對比法往往比單獨分析故障機更有效。


第(dì)六(liù)步:進行交換測試

可以交換:

  • 水(shuǐ)路支路;

  • 電源通信(xìn)線;

  • 控製板;

  • 電源;

  • 算力板排線。

交換時每次隻改變(biàn)一個變量,否則無(wú)法判斷故障來源。


第七步:再(zài)考慮固件(jiàn)處理

隻有在水路確認正常、硬件連接(jiē)正常,但日誌仍存在初始化或版本兼容問題時,再進行固件恢複或升級。


十、現場安(ān)全注意事項

水冷礦機功率較大,供電電流(liú)高,維修風險高於普通電子設備。

必須注意:

  1. 斷電後等待電源內部電容(róng)放電;

  2. 不要帶電插拔算力板排線;

  3. 不要帶壓拆卸水(shuǐ)管;

  4. 防止冷卻液進(jìn)入(rù)控製板和電源;

  5. 拆管前做好接液措施;

  6. 檢查接(jiē)地是否可靠;

  7. 高電流端子必須按規定力矩(jǔ)緊固;

  8. 不要反(fǎn)複快速開關礦機;

  9. 不要為了測試而取消高溫保護;

  10. 不要(yào)在水流不明的情況(kuàng)下強(qiáng)製升頻運行(háng)。

高溫保(bǎo)護不是普通報警,而是防止ASIC、冷板(bǎn)、焊點和供電器件損壞(huài)的重要措施。


十一(yī)、典(diǎn)型故障判斷結論

當日誌同時滿(mǎn)足以下條(tiáo)件時:

board num = 3
三塊算力板均被識別
每塊板ASIC數量完整
電源能夠讀取序列號和校準數據
礦機能夠逐步升頻
最後出現ERROR_TEMP_TOO_HIGH

可以得出以下判斷:

  1. 控製板基本工作正常;

  2. 三(sān)塊(kuài)算力(lì)板通信基本正常;

  3. 電(diàn)源並(bìng)非完全失效;

  4. “get power version failed”不是直接停機原因;

  5. 實際停機原(yuán)因是溫度保護;

  6. 應優先檢查對應鏈的水路、冷板和(hé)溫度檢測。

如果日誌明確顯示:

pic temp(chain2) 81 (max 80)

則應將排查重點(diǎn)放在Chain 2對應(yīng)的冷卻支路和算力板。


十二、故障概率排序

在三塊板ASIC全部識別、升頻(pín)正常、最終(zhōng)因某一路高溫停機的情況下,可以按以下優先級判(pàn)斷:

第一優先(xiān)級(jí):局部(bù)水流不足

包(bāo)括:

  • 軟管堵塞;

  • 接頭未完全打開;

  • 冷板內部堵塞;

  • 氣阻;

  • 閥門問題。

第二(èr)優先級:溫度檢測異常

包括:

  • 傳感器偏移;

  • PIC采樣異常;

  • 板上供電異常。

第三優先(xiān)級:導熱接觸不良

包括:

  • 導熱材料老化;

  • 冷板壓力不均;

  • 機械變形。

第四優先級:固件兼容性問(wèn)題(tí)

固件(jiàn)可能(néng)造成錯誤識別或(huò)溫度策略異常,但在存(cún)在明確單鏈高溫(wēn)的(de)情況(kuàng)下,不應作為第一排查方向。

第五優(yōu)先級:電源故障(zhàng)

如(rú)果電源能夠(gòu)完成(chéng)校準、建立電壓並支持礦機升頻,則其作為本次高溫停機直(zhí)接原因的概率相對較低。


十(shí)三、維修(xiū)後的驗證(zhèng)標準

故障處(chù)理完成後(hòu),不能隻看礦機“開始挖礦”,還應進行持續觀(guān)察。

建議至少驗證以下項(xiàng)目(mù):

  1. 三塊算力板均在線;

  2. ASIC數量完整;

  3. 三塊板溫差合理;

  4. 運行溫度穩定;

  5. 算(suàn)力(lì)達到額定範圍;

  6. 運行30分鍾無停機;

  7. 運行2小時無溫度持續上升;

  8. 日誌中無重複電源通信超時(shí);

  9. 進出水溫(wēn)差穩定;

  10. 總水泵電流和壓力正常。

若礦機剛啟動時正(zhèng)常,但運行十幾(jǐ)分鍾後再次高溫,說明問題可能是係統(tǒng)熱容量不足、總流量不足或換(huàn)熱器能力不夠,而不是單塊板瞬(shùn)時堵塞(sāi)。


結語

Antminer S19 XP Hyd.和S19 XP+ Hyd.水冷礦機的故障診斷,不能僅憑一條日誌或一個溫度值作出判斷。

“get power version failed”並不一定代表電源損壞;“version invalid 5!=4”也不一定表示EEPROM損壞;環境溫度32℃更不(bú)能證明礦機內部不會高溫。

真正有效的診斷方法,是按照礦機啟動順序逐步分析:

控製板啟動
→ 算力板識別
→ EEPROM讀取
→ ASIC識別
→ 電源通信
→ 電壓建立
→ 逐級升頻
→ 溫度監控
→ 保護停機

如果三塊算力板均能識(shí)別完整ASIC,電源(yuán)能夠完成校準,礦機也能升頻至額定頻率,而最後明(míng)確報出某一鏈溫度(dù)超過上限,那麽維修重點就應從電源和固件轉向對應(yīng)的水路、冷板(bǎn)和溫(wēn)度(dù)采集係統。

對於多台水冷礦機集(jí)中運行(háng)的礦場,還應特別關注支路流量平衡、軟管布置、快速接頭(tóu)狀態、係統排氣和固件統一管理。隻有將電氣、通信、熱管理和軟件日誌結合起(qǐ)來,才能避免誤換電源、誤刷固件、誤拆算力(lì)板,並快速找到真正(zhèng)導致礦(kuàng)機(jī)停機的故障(zhàng)點。


 
 
上一篇:華中數控 HNC-210B 主軸不能啟動與“係統顯示低電平但繼(jì)電器吸合(hé)”故障的診斷方法——基於 PLC/PMC 點位定義、急停鏈路與 XS91 主軸接(jiē)口的實戰分析
下一篇:

廣東91视频网址入口機電科技有(yǒu)限(xiàn)公司(sī) 保留所有版權粵ICP備(bèi)10022083號


91视频网址入口_91免费视频网站_www.91视频.com_91免费观看网站入口