先說結論:會寫程式碼,和完成工作,是兩件事
很多人第一次試 AI 資料分析,會丟一份 CSV,再說:「幫我清理資料、做圖、找趨勢、給建議。」如果 Agent 很快吐出一段可以執行的程式碼,看起來就像任務完成了。
但營運團隊真正要交付的,通常不是一段程式碼,而是一份能拿去開會、能被追問、能回到資料來源的結果。資料有沒有讀對?欄位定義有沒有誤解?圖表是否真的回答問題?最後的建議要由誰負責?這些都在程式碼之外。
這就像請同事整理月底資料:報告排版漂亮,不代表他用了正確檔案、算對公式、回答了主管真正要問的問題。你會要求他附上來源、計算方式與待確認事項;AI Agent 也需要同樣的交付規則。
7Pyramid 觀點
AI 能把程式碼跑起來,只代表它通過了「會動」這一關。真正能不能交付,還要看資料、計算、成果與責任能不能一起被檢查。
研究測的不是單點聰明
DSAgentBench 論文於 2026 年 8 月 11 日公開。作者把資料整理、探索、建模、視覺化與驗證放在同一個長流程裡,讓 Agent 在真實作業系統環境中協調筆記本、整合開發環境、終端機、瀏覽器與資料庫。275 個任務各自有確定性評估器,不只看程式碼能不能執行,也檢查分析正確性、視覺化成果與模型表現。〔S1〕
作者在這個測試設定中評估 15 個閉源與開源模型;論文報告的最佳 Agent 任務成功率為 56.70%,所有開源 Agent 都低於 1%,常見失敗方向包括工具協調、作業系統操作與多步驟推理。這些數字只代表研究團隊在特定任務、模型版本與環境中的結果,不是你公司的預測成績單。〔S1〕
中小企業最容易漏掉的四個問題
如果流程只驗收「程式有沒有跑完」,團隊可能忽略資料範圍、分析假設、圖表語意和下一步行動。漂亮的輸出反而會讓錯誤更難被發現,因為大家容易把完成的外觀誤認成完成的工作。
| 研究提醒 | 工作現場要追問什麼 |
|---|---|
| 資料整理與探索 | Agent 用的是指定檔案、期間與欄位嗎? |
| 建模與計算 | 公式、篩選條件與中間結果能回到來源嗎? |
| 視覺化 | 圖表真的回答原本的商業問題嗎? |
| 驗證與交付 | 誰要複核,哪些限制與待確認事項要留下來? |
上表是 7Pyramid AI 的實作翻譯,不是論文宣稱的企業產品功能。它的目的,是讓「Agent 看起來很會」變成一套可以重複使用的驗收問題。
解法:建立四欄交付閘門
每次讓 Agent 交付資料分析結果時,我建議固定要求四欄:
| 交付閘門 | 最低驗收內容 | 人工要確認什麼 |
|---|---|---|
| 資料 | 檔案、期間、欄位與資料版本 | 是否讀到核准來源,是否漏掉必要範圍 |
| 計算 | 公式、篩選條件與中間結果 | 口徑是否正確,數字能否回溯 |
| 成果 | 圖表、摘要與原始問題的對應 | 是否真的回答決策問題,是否誤導讀者 |
| 責任 | 未確定事項、覆核人與下一步 | 誰能核准,誰不能讓 Agent 自行執行 |
這張卡像月底交接單:不是要求同事把每個細節寫成論文,而是確保交付物有來源、有過程、有結論,也有一個真的負責的人。
今天就做:用一份去個資 CSV 小試跑
拿一份不含個資的 CSV 或公開資料,選一個單一問題,例如「哪一個月份的商品類別需要進一步檢查?」請 Agent 同時交回:
- 使用的檔案與欄位清單。
- 計算方式與一個可抽查的中間結果。
- 一張圖或一段短摘要,並說明它回答了哪個問題。
- 未確定事項、資料限制,以及需要人工核准的地方。
接著用四欄交付閘門逐項打勾。任何一欄答不出來,就先不要接真實客戶資料,也不要擴大工具權限;先修正任務描述、資料格式或驗收標準,再重跑一次。請保留原始資料副本、提示版本、輸出檔案、錯誤紀錄與核准結果,讓下次可以比較流程是否真的變穩定。
公開實作,不等於可以直接上線
DSAgentBench 的 GitHub repository 是公開專案,頁面標示 Apache-2.0 授權。這讓開發者可以檢視任務與工具設計,但「可以查看或重跑」和「適合直接接進你的營運流程」仍是兩件事。〔S2〕
benchmark 的分數也不能取代你自己的資料、權限與人工審核測試。財務、醫療、法律、薪資與個人資料等高風險工作,最後判斷應由適合的專業人員負責;Agent 即使能生成可執行程式碼,也可能選錯檔案、誤解欄位或在多步驟中失去脈絡。
結論:先驗收完整交付,再談更多自主性
DSAgentBench 的價值,不只在於一個 benchmark 分數,而在於它把「資料分析 Agent 能不能工作」問得更接近真實現場:它有沒有找到正確資料、完成正確計算、產出有用成果,並留下可以讓人接手的證據?
先讓 Agent 通過小型、可回溯、有人複核的四欄交付閘門,再談更多工具、更大資料和更高自主性。這個順序會讓 AI 從漂亮的 demo,慢慢變成可以負責的工作流程。
常見問題
DSAgentBench 是一個可以直接使用的 AI 分析產品嗎?
不是。DSAgentBench 是用來測試 AI Agent 能否在真實電腦環境完成端到端資料科學工作的 benchmark,公開 repository 可供檢視,但不等於你的企業可以直接上線。
論文報告的 56.70% 任務成功率代表我的公司也會有相同結果嗎?
不代表。56.70% 是作者在特定任務、模型版本與環境中的報告;它不能直接預測不同資料、權限、工具與人工流程下的企業結果。
中小企業要怎麼安全測試資料分析 Agent?
先使用去個資的 CSV 或公開資料,要求 Agent 同時交回資料來源、計算方式、中間結果、圖表或摘要、未確定事項,再用資料、計算、成果與責任四欄逐項人工驗收。
資料來源
- S1|arXiv:DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?
- S2|GitHub:vis-nlp/DSAgentBench
本文中的四欄交付閘門、去個資試跑與人工覆核流程,是 7Pyramid AI 根據研究提醒提出的實作建議;論文的 benchmark 結果只代表作者在特定測試設定中的報告,不是任何企業的成效保證。
