新聞

代理式AI逐漸進入程式開發流程,也讓AI代理的除錯、追蹤與評估成為新的開發課題。可觀測性新創業者Raindrop AI推出開放原始碼工具Workshop,定位為AI代理本機除錯與評估工具,可將AI代理執行過程中的追蹤記錄,即時串流到瀏覽器介面,協助開發者檢查AI代理執行過程中的大型語言模型呼叫、工具呼叫、決策過程,以及發生錯誤的原因。

Workshop採MIT授權釋出,官方提供macOS與Linux的一鍵安裝方式,GitHub Releases頁面也提供Windows x64可執行檔。根據VentureBeat報導,Workshop以本機常駐服務程式搭配使用者介面運作,預設可在localhost:5899開啟介面,並將每個權杖、工具呼叫與決策寫入單一SQLite資料庫檔案,讓開發者可在本機檢查AI代理在哪個步驟出錯、何時出錯,以及可能的失敗原因。

Raindrop在官方部落格指出,AI代理除錯的困難在於,失敗原因經常藏在多層巢狀的span(追蹤區段)記錄。開發者只能查看終端機輸出,或必須仰賴延遲呈現的SaaS儀表板,最後仍要手動閱讀大量追蹤記錄並撰寫評估測試。Workshop則提供兩種介面,一是本機即時追蹤記錄檢視器,二是透過模型上下文協定(MCP)連接Claude Code,讓AI程式開發代理讀取同一批追蹤記錄。

這套工具另一項重點,是Raindrop稱為「自我修復評估循環」的機制。當AI代理執行失敗,Workshop會保留完整執行軌跡,Claude Code可讀取這些記錄,依據實際失敗案例產生評估測試,找出提示詞或程式碼中的邏輯問題,再重新執行代理,直到測試條件通過。Raindrop強調,這種做法讓開發者可根據實際發生過的故障進行測試,而不是自行推測可能情境。

在相容性方面,Raindrop說明Workshop支援TypeScript、Python、Go與Rust,並可整合Vercel AI SDK、OpenAI Agents SDK、Anthropic SDK、Claude Agent SDK、LangChain、LangGraph與CrewAI等SDK與框架,也能搭配Claude Code、Codex、Devin、Cursor與OpenCode等程式開發代理使用。Raindrop另指出,Workshop沿用與其正式環境除錯體系相同的追蹤架構。