新聞

AI日益普及帶來許多便利之餘,然而,近期陸續傳出幾起AI誤刪資料的事故,引發恐慌,企業該如何預防這類意外的發生?隨著越來越多企業建置大數據資料分析環境與AI工廠基礎設施,以及因應接踵而來的勒索軟體網路攻擊與資料外洩威脅,企業如何具備足夠的資料保護能力?長期推廣企業儲存系統與資料保護領域的NetApp台灣技術總監許宏俊認為,維持原始資料的完整性與可靠性,提升資料存取行為的分析能力,靈活運用快照副本,可以兼顧確保存取效能與資料持續保護的需求。

因應發展AI應用面臨的存取效能衝擊,NetApp快照技術可快速提供副本,協助企業提升資料使用彈性

在當前企業IT應用中,AI可能執行在內部網路環境或是單機系統(例如OpenClaw),企業正在發展的AI使用管道,涉及的資料存取情境非常多元,有可能是位於同一個叢集的系統中,也有可能是使用經過處理後的資料,因此,企業該如何從儲存系統的角度,預防AI誤刪資料的突發狀況?許宏俊認為,重點是對於原始資料(raw data)或來源端資料,必須設法進行完整的保存,然後設置獨立於這些資料之外的暫時副本,將其提供給AI代理程式或不同的AI情境使用。

他強調,首先企業要確保原始資料的完整性,因為一旦遭到破壞,後續往往要耗費很多時間修復;其次,從原始資料衍生的副本資料,一定會有使用時效的限制,企業須考量維護副本資料所需花費的成本。若要達到上述需求,企業必須改善資料的處理流程,而非只是將儲存系統視為簡單的儲存資源,以及能否提供高效能的資料存取方式。

舉例來說,如果原始資料容量為100 TB,同時有8位資料科學家、8個AI使用情境或AI代理,都要使用這份資料,企業此時的考量在於,需花多少時間建立8個副本資料,以便能夠供應8個人或8個AI代理使用。許宏俊表示,NetApp可協助用戶在幾分鐘內完成這些準備工作,而且過程中不需透過任何儲存管理語言進行描述與操作。

對於資料科學家而言,他們通常經由入口網站的前端介面,宣告現在使用的資料、執行的AI模型與各種工具,接著要串連後端的GPU資源與儲存資源,NetApp此時可提供標準API介面,使這些AI平臺能完整銜接。基於這樣的架構,當前端使用者獲得授權,到入口網站提交相關處理請求,幾分鐘後AI平臺即可將資料準備好,使其能開始著手進行分析與開發的工作。

關於副本資料的時效性,這會涉及儲存成本的管控。

一般而言,若要建立獨立的副本,往往須因此耗用相同容量的儲存空間,例如原始資料有10 TB,為了要建立獨立的副本資料,通常須備妥另一個10 TB的儲存空間,再將這些資料提供前端使用。不過,這麼一來,儲存系統每次執行副本抄寫,通常須耗費一段時間,資料科學家只能等待這些準備作業完成,才能進行後續工作;若為了節省時間,將企業的原始資料直接開放給資料科學家存取,又會影響原始資料的公正性與正確性。

許宏俊表示,對於NetApp儲存系統的用戶而言,副本資料與原始資料是彼此連動的,副本資料內容後續若有異動,系統僅將變更的部分存放在獨立的儲存空間。

這麼做有幾個好處,首先,當資料科學家結束專案、不再使用手上的副本資料時,儲存系統能輕易回收空間;若資料科學家後續打算將這份副本交給別人處理,也可以透過入口網站快速將資料掛載到下一個專案執行。

在這樣的資料架構下,若使用者在本身處理的專案不小心誤刪資料,其實只影響他正在存取的副本資料,而不會影響企業的原始資料;以AI專案而言,儲存系統也可針對不同工作階段的檢查點(checkpoint)產生快照,為這個時間點的資料提供完整的保護,若在處理過程中不慎做錯,只需重新提交相關請求,即可將資料回復至出錯前的時間點,提供多個版本的使用方式。

善用NetApp儲存系統平臺ONTAP與開放原始碼軟體Trident的功能,企業可彈性調度儲存資源

上述建議的作法是NetApp與一些客戶進行實作後的經驗談,藉此改善整體流程,當中用到哪些產品?

許宏俊表示,不論資料的副本快速建立、快照產生或API使用,都包含在NetApp長期發展的儲存作業系統平臺ONTAP;而在AI基礎架構的整合上,NetApp的產品也獲得Nvidia的認證,透過預先定義的軟硬體相容性要求,共同設計出立即可用的AI解決方案,這當中包含關鍵的容器化應用技術Trident。如果NetApp客戶想要發展AI專案或有容器化技術應用需求,均可自行從網路下載Trident,然後由NetApp或合作廠商幫忙建置。

Trident是由NetApp發展與支援的開放原始碼軟體,問世至今已逼近10年之久,提供符合容器儲存介面(CSI)的動態儲存調度機制,可打通前端的容器與底層的NetApp儲存系統,使儲存系統能接收到前端發出的指令,然後執行快速部署、資料備份,甚至異地備援,協助NetApp的產品成為適用AI與容器化架構的儲存系統。

在系統運作上,Trident可透過單一控制器Pod搭配每個工作節點的節點Pod的架構執行,而且能原生整合Kubernetes,以及直接整合Docker生態系統,能經由NetApp Docker Volume Plugin(nDVP)的形式,支援Docker主機與NetApp儲存平臺的儲存資源供應與管理。Trident支援的NetApp儲存平臺,涵蓋企業內部環境建置的ONTAP硬體叢集系統(AFF系列、FAS系列、ASA系列)、軟體系統ONTAP Select、Element(NetApp HCI與SolidFire),以及雲端環境建置的Cloud Volumes ONTAP、Azure NetApp Files、Amazon FSx for NetApp ONTAP。

許宏俊表示,這樣的架構所搭配的NetApp儲存系統,不一定是最高階的產品,也可以是入門級產品,所以,企業用GPU伺服器建置AI基礎架構時,無論搭配NetApp提供的小型儲存系統,或容量擴展到上百PB、甚至EB等級的大型儲存系統,皆能依照相同的方式建置上述的資料處理與控管環境。

目前在臺灣是否有企業或組織實際採用上述做法?許宏俊說,NetApp經常舉出的例子是國家衛生研究院(NHRI建置AI 生醫資訊創新研究暨應用服務中心,在這個與華碩雲端、Nvidia合作的專案,NetApp最大的貢獻在於協助改善資料存取流程的部分,使資料串接非常順暢,在最短時間內提供科學家真正需要的資料,並且能瞬間將同一份資料集產生大量副本,因應不同研究專案或模型的運用需求,而非只是供應高速的儲存系統。

NetApp解決方案能偵測非法大量存取資料的內部威脅,企業可預防先竊取後解密的量子安全風險

為了便利AI的導入,企業除了需設法提升資料的使用彈性與存取效能,保護資料的需求跟著水漲船高,當資料趨於集中之後,也會成為駭客攻擊的重要目標。

攻擊者一旦潛入企業掌控的內部或雲端環境,並不會為了綁架資料而急著執行廣泛的加密攻擊,許宏俊提醒,他們可能會先竊取企業的資料,並且刪除企業的資料備份與快照。

以企業資料遭竊而言,若是完全沒加密的個人資料與機密資料,一旦遭到外洩,可能嚴重影響企業信譽,面臨政府重罰與龐大賠償,攻擊者也能藉此向企業進行勒索,脅迫其須支付贖金才能免於重大損失。

而且,企業遭竊的資料可能包含已加密的資料,雖然攻擊者短期無法破解這些被加密演算法保護的資料,但量子電腦技術突飛猛進,距離實用階段已愈來愈近,原本需要幾百萬年才能破解加密的資料,屆時可能只需要幾天或幾小時就能完成,因此,企業現在就必須盡快盤點密碼學資產,以及導入後量子密碼學(PQC)技術,及早因應「先竊取後解密(HNDL)」的量子威脅。

企業該如何快速知道現有資料是否遭到竊取?通常攻擊者會先設法駭入高權限的帳號,甚至綁架Windows AD或LDAP這類目錄服務 ,再建立新的帳號進行存取,許宏俊表示,NetApp提供使用者行為分析的功能,企業可透過NetApp發展的SaaS雲端服務解決方案,分析使用者如何存取資料。

舉例來說,假設員工平均每天存取100個檔案,有一天突然存取1萬個檔案,顯然這是異常行為,若沒有這類工具幫忙,企業很難察覺,有些公司透過網路流量進行分析,但除非有獨立流量,否則很容易受到一些情境的干擾,而且也很難判斷是誰在異常存取。

NetApp的解決方案對此可提供更準確的分析,企業可得知特定資料夾或儲存區的AD使用者資料存取狀況,一旦偵測到特定帳號有異常行為,就會發出警示,提醒管理者發生哪些使用者發生這類狀況,此時,企業可進一步查核這個帳號存取的資料,並且將其與群體使用者(例如同部門的其他員工)的存取模式進行比較,以便在行為改變的幾天之內,就能判斷是否有風險。

許宏俊認為,偷資料的行為通常會經歷一段時間與過程,很少在一天內把資料全部偷走,而透過上述的行為分析功能,可協助企業偵測與防範資料外洩的行為。

協助企業防範勒索軟體加密攻擊,NetApp提供快照鎖定、預判勒索軟體I/O模式的快照產生,以及快速復原技術

除了竊取資料作為向受害者勒索的籌碼,攻擊者接下來往往會設法刪除資料的備份與儲存系統的快照,因為取走資料後,攻擊者會對既有資料執行加密、甚至抹除的破壞動作,一旦刪除所有備份與快照,等於受害者沒有任何退路,而被迫支付贖金,以便解開遭加密的資料或取回資料。

因應這樣的攻擊方式,NetApp提供SnapLock的功能,可在儲存系統產生快照時,持續鎖定這個時間點的快照,必須超過設定期限之後才能刪除這個快照,後續若要修改鎖定快照的保存期間,只能延長而不能縮減,例如,原先快照鎖定期間設為10天,只能改為11天、12天或其他更長的保存時間,而不能改為1天,就算擁有系統最高權限,或原廠人員親自到場處理,都無法在這段保存期間內刪除快照,如此一來,可為企業資料的保全設下最後一道防線。

而在勒索軟體攻擊的預防對策上,市面上多數號稱具有這類功能的資料保護系統,是根據資料的變動量來判斷。NetApp提供的解決方案主要是利用I/O模式的變化進行偵測,在勒索軟體發動的極短時間內(幾秒內),即可察覺I/O行為出現異常而通知管理者,並促使儲存系統當下產生快照,後續使用者可尋找問題發生前的乾淨快照,進行資料回復。

許宏俊表示,重要的是產線與服務必須持續運作,因為當企業面臨到資料無法存取的問題,最大的壓力就是需要花費多久時間才能復原,對此,由於NetApp的強項在於提供資料快速復原技術,以及應用程式的密切整合,所以,無論資料量有1 PB、10 PB或100 PB,都能在幾分鐘之內完成復原作業。

NetApp之所以能做到資料快速復原,並非採用業界常見的寫入時複製技術(Copy-on-Write,CoW),若導入此種作法,當儲存系統執行資料寫入時,會把原本區塊的資料複製出來、放到其他位置,再將打算寫入的資料寫入儲存區。許宏俊表示,NetApp是在儲存平臺ONTAP底層使用的專屬檔案系統「隨處寫入檔案布局(WAFL)」提供寫入時重新導向技術(Redirect-on-Write,RoW),透過變更inode,將快照保護的資料區塊保存在原本的區塊,並將新的資料寫入另一個區塊,之後執行重新連結的動作。由於ONTAP系統持續維護inode,後續復原資料時,只需更換容量僅幾KB的inode即可,不需複製任何資料,因此快照建立與資料還原所需時間很短。

根據NetApp相關的部落格文章說明指出,基本上,ONTAP快照採用的RoW技術,若快照保護的資料區塊需要修改,系統會將寫入的資料放到新的儲存區塊,並且更新正在使用的檔案系統指標,將其指向這些區塊。而且,相較於採用CoW技術每次修改資料區塊需要3次I/O操作,ONTAP快照只需要1次寫入I/O操作;從快照復原資料時,ONTAP快照所需要的運算資源較少,因為快照指標始終指向資料區塊的原始位置,由於資料區塊本身是鎖定狀態,所以只要快照存在,這些資料區塊就永遠不會被覆寫。

事實上,快照本身是多組獨立存在的指標,與正在使用的檔案系統指標所指向的位置無關。在這樣的運作架構下,當企業執行資料復原作業時,正在使用的檔案系統指標都會被更新,以便符合快照的指標,如此一來,只需要幾秒就能完成TB等級的資料復原。

至於WAFL與inode在NetApp快照技術扮演何種角色?NetApp另一篇部落格文章提到,在WAFL檔案系統中,資料是以多個inode互連而形成單一階層結構的方式排列,位於頂層的檔案是根inode(root inode),存放在固定位置的區塊中,可用於追蹤儲存區的其他資料區塊,快照技術的運作,主要是基於根inode唯讀副本的建立,檔案系統所有資料與中繼資料的特定時間點狀態,會保存在這份副本,因此,快照副本可充當這個檔案系統的唯讀參考點,後續會以增量的方式建立快照副本,所以只需寫入後續變更的資料。

支援分散式儲存應用需求,NetApp遠端快取技術可加速多據點的企業儲存處理、節省網路頻寬與執行存取控管

至於供應鏈這類跨越多個公司的資料存取需求,在NetApp儲存系統當中,若要做到資料外洩預防,許宏俊表示,企業可導入FlexCache技術,兼顧多方資料共享、就近存取、資料控管等多種需求。

在這樣的架構下,總公司可將特定資料夾或儲存區,透過遠端資料快取的處理,將儲存資料對應到另一臺位於分公司或合作廠商的NetApp儲存設備,或是NetApp雲端儲存服務,這些儲存系統可存放完整的中繼資料副本,使企業的原始資料能夠支援分散式環境的應用,就近供當地的使用者存取、減少跨網路存取的頻寬耗用,並且進行存取行為的控管。

而在AI基礎架構當中,資料儲存同樣需要根據存取頻率高低,而區分為多個階層,例如將常用的專案放到高效能的儲存系統,不常用的專案放到成本低廉的儲存區,NetApp可串接這些儲存階層,形成單一命名空間,並且自動執行當中的儲存分層處理(Tiering),而不需手動複製或搬移,同時提供原始資料保存、資料快速備份與復原,以及長期存取監控等功能。