我們幫你的 AI 打一個看得懂的分數
準確率、幻覺、RAG 命中率、回歸、成本、風險,六個面向各出一個數字。先免費快篩,再決定要不要往下。
你可能正卡在這裡
AI 上線之後最難的不是它會不會動,是你說不出它現在到底有多準、多穩、多貴。
只能靠感覺
- 說不出它到底準不準。
- 只能一則一則試,試到覺得可以。
- 換個人問,結論就不一樣。
我們的做法用同一套題目重複測,給你一個可以追蹤的數字。
改完怕改壞
- 調了 prompt,不知道別的地方有沒有壞。
- 沒有一套可以重跑的題目。
- 每次改版都像重新賭一次。
我們的做法交付一套回歸腳本,改版前先跑一次就知道有沒有改壞。
不知道在燒什麼
- 帳單一個月比一個月高。
- 看不出哪一支呼叫最貴。
- 也不知道哪些呼叫其實可以不打。
我們的做法成本拆到每次呼叫,指出可以省的地方。
我們量哪六項
同一套題目重複跑,每一項出一個可以追蹤的數字。下次改版再跑一次,就知道變好還是變壞。
準確率
- 回答對不對、跟標準答案差多少。
- 分情境給分,不只給一個總平均。
- 產出一條可追蹤的基線。
幻覺率
- 有沒有編造不存在的事。
- 算出發生比例。
- 附上典型的翻車案例。
RAG 命中率
- 該找到的段落有沒有找到。
- 引用的是不是對的那一段。
- 列出答非所問與漏答的題目。
回歸測試
- 這次調整有沒有把上一版弄壞。
- 交付一套可重複執行的腳本。
- 改版前先跑一次。
成本
- 每次呼叫花多少 token、多少錢。
- 找出最貴的那幾支。
- 指出可以合併或省掉的呼叫。
風險
- Prompt injection、越權、資料外洩。
- 對照 OWASP、ISO、NIST 與金管會指引。
- 給一份修復優先序。
三個等級怎麼選
先做免費快篩看值不值得往下。要往下的話,依你要的深度選一個。
L1 標準檢測
- 要一條基線數字。
- 之後每次改版都能比。
- 含回歸腳本與中文報告。
L2 深度檢測
- 已經有基線,想知道為什麼不準。
- 含 workflow 優化診斷。
- 含輕量程式碼審計。
L3 企業級治理
- 要對應 OWASP、ISO、NIST 與金管會指引。
- 含完整系統與資安審計。
- 含治理框架與導入陪跑。
價格
免費快篩不綁後續。單次檢測與月費健檢可以分開買。
免費快篩
通常包含:少量真實問題跑一輪,給你大方向與「值不值得做完整檢測」的建議。
會影響報價:不綁後續。
實際價格會在需求釐清後確認 · 第一次諮詢免費
L1 標準檢測
通常包含:準確率、幻覺率、RAG 命中率基線量測,回歸測試腳本,中文報告加一次線上講解。
會影響報價:題庫規模、要測的情境數。
實際價格會在需求釐清後確認 · 第一次諮詢免費
L2 深度檢測
通常包含:含 L1 全部,加上 workflow 優化診斷、輕量程式碼審計與修復優先序清單。
會影響報價:系統複雜度、要不要含程式碼審計。
實際價格會在需求釐清後確認 · 第一次諮詢免費
L3 企業級治理
通常包含:完整系統與資安審計、治理框架、法遵對應(OWASP/ISO/NIST/金管會指引)與導入陪跑。
會影響報價:法遵範圍、系統數量、陪跑期長短。
實際價格會在需求釐清後確認 · 第一次諮詢免費
月費健檢
通常包含:持續監控幻覺率、RAG 命中率、回歸與工具呼叫失敗率,每月中文健檢報告與異常告警。
會影響報價:監控頻率與項目數。分基礎/專業/企業三檔,年繳有折扣。
實際價格會在需求釐清後確認 · 第一次諮詢免費
如何進行
先做免費快篩看值不值得往下。要往下的話,依你要的深度選一個等級。
- 01
免費快篩
- 用少量真實問題跑一輪。
- 給你大方向與明顯的翻車類型。
- 告訴你值不值得做完整檢測。
- 02
建題庫
- 用你的真實問題建一套測試集。
- 標準答案跟你一起確認。
- 這套題目之後每次都重跑。
- 03
量測
- 六個面向各跑一輪。
- 每一項出一個數字。
- 同一套題目、同樣條件,可以比較。
- 04
報告與修復序
- 一份中文報告,每個數字附一句解讀。
- 一次線上講解。
- 附上該先修哪幾項。
常見問題
免費快篩會看到什麼?
我們用少量真實問題跑一輪,給你一個大概的準確率與明顯的翻車類型,再告訴你值不值得做完整檢測。
為什麼不能直接保證準確率?
準確率跟你的題目分布綁在一起。我們能做的是量出現在的數字、指出可以改善的地方,然後用同一套題目驗證改善有沒有發生。
檢測報告看得懂嗎?
報告是中文的,每個數字都附一句「這代表什麼」,並且有一次線上講解。
檢測完你們會順便修嗎?
會給修復優先序。要我們動手修可以另外談,也可以交給原本的廠商修,我們再驗一次。
已經導入別家做的 AI,你們能幫忙檢測嗎?
可以。先做免費快篩看大方向,要深入再談標準或深度檢測。