我們幫你的 AI 打一個看得懂的分數

準確率、幻覺、RAG 命中率、回歸、成本、風險,六個面向各出一個數字。先免費快篩,再決定要不要往下。

你可能正卡在這裡

AI 上線之後最難的不是它會不會動,是你說不出它現在到底有多準、多穩、多貴。

  • 只能靠感覺

    • 說不出它到底準不準。
    • 只能一則一則試,試到覺得可以。
    • 換個人問,結論就不一樣。

    我們的做法用同一套題目重複測,給你一個可以追蹤的數字。

  • 改完怕改壞

    • 調了 prompt,不知道別的地方有沒有壞。
    • 沒有一套可以重跑的題目。
    • 每次改版都像重新賭一次。

    我們的做法交付一套回歸腳本,改版前先跑一次就知道有沒有改壞。

  • 不知道在燒什麼

    • 帳單一個月比一個月高。
    • 看不出哪一支呼叫最貴。
    • 也不知道哪些呼叫其實可以不打。

    我們的做法成本拆到每次呼叫,指出可以省的地方。

我們量哪六項

同一套題目重複跑,每一項出一個可以追蹤的數字。下次改版再跑一次,就知道變好還是變壞。

  • 準確率

    • 回答對不對、跟標準答案差多少。
    • 分情境給分,不只給一個總平均。
    • 產出一條可追蹤的基線。
  • 幻覺率

    • 有沒有編造不存在的事。
    • 算出發生比例。
    • 附上典型的翻車案例。
  • RAG 命中率

    • 該找到的段落有沒有找到。
    • 引用的是不是對的那一段。
    • 列出答非所問與漏答的題目。
  • 回歸測試

    • 這次調整有沒有把上一版弄壞。
    • 交付一套可重複執行的腳本。
    • 改版前先跑一次。
  • 成本

    • 每次呼叫花多少 token、多少錢。
    • 找出最貴的那幾支。
    • 指出可以合併或省掉的呼叫。
  • 風險

    • Prompt injection、越權、資料外洩。
    • 對照 OWASP、ISO、NIST 與金管會指引。
    • 給一份修復優先序。

三個等級怎麼選

先做免費快篩看值不值得往下。要往下的話,依你要的深度選一個。

  • L1 標準檢測

    • 要一條基線數字。
    • 之後每次改版都能比。
    • 含回歸腳本與中文報告。
  • L2 深度檢測

    • 已經有基線,想知道為什麼不準。
    • 含 workflow 優化診斷。
    • 含輕量程式碼審計。
  • L3 企業級治理

    • 要對應 OWASP、ISO、NIST 與金管會指引。
    • 含完整系統與資安審計。
    • 含治理框架與導入陪跑。

價格

免費快篩不綁後續。單次檢測與月費健檢可以分開買。

免費快篩

NT$0

通常包含:少量真實問題跑一輪,給你大方向與「值不值得做完整檢測」的建議。

會影響報價:不綁後續。

實際價格會在需求釐清後確認 · 第一次諮詢免費

L1 標準檢測

NT$3.6–5.8 萬

通常包含:準確率、幻覺率、RAG 命中率基線量測,回歸測試腳本,中文報告加一次線上講解。

會影響報價:題庫規模、要測的情境數。

實際價格會在需求釐清後確認 · 第一次諮詢免費

L2 深度檢測

NT$8.8–15 萬

通常包含:含 L1 全部,加上 workflow 優化診斷、輕量程式碼審計與修復優先序清單。

會影響報價:系統複雜度、要不要含程式碼審計。

實際價格會在需求釐清後確認 · 第一次諮詢免費

L3 企業級治理

NT$30 萬起

通常包含:完整系統與資安審計、治理框架、法遵對應(OWASP/ISO/NIST/金管會指引)與導入陪跑。

會影響報價:法遵範圍、系統數量、陪跑期長短。

實際價格會在需求釐清後確認 · 第一次諮詢免費

月費健檢

NT$8,000–3 萬/月

通常包含:持續監控幻覺率、RAG 命中率、回歸與工具呼叫失敗率,每月中文健檢報告與異常告警。

會影響報價:監控頻率與項目數。分基礎/專業/企業三檔,年繳有折扣。

實際價格會在需求釐清後確認 · 第一次諮詢免費

如何進行

先做免費快篩看值不值得往下。要往下的話,依你要的深度選一個等級。

  1. 01

    免費快篩

    NT$0
    • 用少量真實問題跑一輪。
    • 給你大方向與明顯的翻車類型。
    • 告訴你值不值得做完整檢測。
  2. 02

    建題庫

    1 週
    • 用你的真實問題建一套測試集。
    • 標準答案跟你一起確認。
    • 這套題目之後每次都重跑。
  3. 03

    量測

    1–2 週
    • 六個面向各跑一輪。
    • 每一項出一個數字。
    • 同一套題目、同樣條件,可以比較。
  4. 04

    報告與修復序

    驗收
    • 一份中文報告,每個數字附一句解讀。
    • 一次線上講解。
    • 附上該先修哪幾項。

常見問題

免費快篩會看到什麼?

我們用少量真實問題跑一輪,給你一個大概的準確率與明顯的翻車類型,再告訴你值不值得做完整檢測。

為什麼不能直接保證準確率?

準確率跟你的題目分布綁在一起。我們能做的是量出現在的數字、指出可以改善的地方,然後用同一套題目驗證改善有沒有發生。

檢測報告看得懂嗎?

報告是中文的,每個數字都附一句「這代表什麼」,並且有一次線上講解。

檢測完你們會順便修嗎?

會給修復優先序。要我們動手修可以另外談,也可以交給原本的廠商修,我們再驗一次。

已經導入別家做的 AI,你們能幫忙檢測嗎?

可以。先做免費快篩看大方向,要深入再談標準或深度檢測。