● MIT 開源

TrustLens

你的 chatbot 或 RAG 到底準不準,跑一次就知道

TrustLens 是一支 AI 可信度健檢工具。拿你自己的問答題庫,對 chatbot 或 RAG 系統跑一輪,產出一份 0 到 100 的可信度分數與紅綠燈,告訴你「上線之後,它會在哪裡答錯、答歪、亂編」。

Python 3.11+
執行環境
零相依
依賴
本機執行
隱私 · 金鑰不外送
MIT
授權

demo 很漂亮,不代表上線會準

你看到的是一場順暢的問答 demo,挑的是會答對的題目。你看不到的是真實上線後:使用者問法千奇百怪、檢索抓錯段落、模型一本正經地編出看似合理卻錯誤的答案。問題是,在你把 chatbot 推到客戶面前之前,沒有人用一套客觀題庫量過它到底答對幾成、又在哪裡最容易出錯。TrustLens 就是來做這件量測的。

五個維度,一頁看懂你的 AI 可不可信

打開 report.html,你會拿到一個總分、紅綠燈、最高風險的錯誤答案清單,以及五大維度的計分卡。

01

正確性

答案與標準答案相符的程度。

02

相關性

回答是否切題,有沒有答非所問。

03

忠實度

答案是否忠於檢索到的內容,還是模型自己編的(hallucination)。

04

檢索品質(RAG)

有沒有抓到對的段落餵給模型。

05

穩定性

同類問題的答案是否一致、可重現。

三個設計,讓你敢直接拿公司資料來測

零相依

只用 Python 標準函式庫,不用 GPU、不裝一堆套件,好過資安審查、跑得動舊環境。

本機執行、金鑰不外送

離線啟發式評分免金鑰;若要用 Claude API 深評,金鑰留在你機器上,題庫與答案不會經過 Peakstar。

唯讀

只讀題庫、評分、產報告,絕不碰你的資料。

我們把話說清楚:它做什麼,刻意不做什麼

TrustLens 會做

  • 用你的問答題庫量化 chatbot / RAG 的可信度
  • 找出最高風險的錯誤答案,標出在哪個維度失分
  • 給你一份上線前可以對內溝通的客觀報告

它刻意不做(因為這些需要脈絡與判斷)

  • 不幫你修 prompt、不調 RAG 參數、不重訓模型
  • 不替你生領域題庫,也不替你定義什麼叫「答對」
  • 不接你的客服系統做線上監控

這條線是故意畫的。量測可以自動化,調校不行。把分數變成真正可信的 AI 助理,得靠你領域的題庫設計與調校策略。針對金融、醫療、法遵等高風險場景的題庫設計與深度評測,由 Peakstar 於合作專案中提供。

從一個分數,到真正可信的 AI

如果你的報告是黃燈或紅燈,那不是壞消息,而是在推到客戶面前之前先看見問題的機會。Peakstar 在台灣與日本中小企業每天在做的,就是把卡在「準不準」這一關的問題解開。