● MIT 開源
你的 chatbot 或 RAG 到底準不準,跑一次就知道
TrustLens 是一支 AI 可信度健檢工具。拿你自己的問答題庫,對 chatbot 或 RAG 系統跑一輪,產出一份 0 到 100 的可信度分數與紅綠燈,告訴你「上線之後,它會在哪裡答錯、答歪、亂編」。
你看到的是一場順暢的問答 demo,挑的是會答對的題目。你看不到的是真實上線後:使用者問法千奇百怪、檢索抓錯段落、模型一本正經地編出看似合理卻錯誤的答案。問題是,在你把 chatbot 推到客戶面前之前,沒有人用一套客觀題庫量過它到底答對幾成、又在哪裡最容易出錯。TrustLens 就是來做這件量測的。
打開 report.html,你會拿到一個總分、紅綠燈、最高風險的錯誤答案清單,以及五大維度的計分卡。
答案與標準答案相符的程度。
回答是否切題,有沒有答非所問。
答案是否忠於檢索到的內容,還是模型自己編的(hallucination)。
有沒有抓到對的段落餵給模型。
同類問題的答案是否一致、可重現。
只用 Python 標準函式庫,不用 GPU、不裝一堆套件,好過資安審查、跑得動舊環境。
離線啟發式評分免金鑰;若要用 Claude API 深評,金鑰留在你機器上,題庫與答案不會經過 Peakstar。
只讀題庫、評分、產報告,絕不碰你的資料。
這條線是故意畫的。量測可以自動化,調校不行。把分數變成真正可信的 AI 助理,得靠你領域的題庫設計與調校策略。針對金融、醫療、法遵等高風險場景的題庫設計與深度評測,由 Peakstar 於合作專案中提供。
如果你的報告是黃燈或紅燈,那不是壞消息,而是在推到客戶面前之前先看見問題的機會。Peakstar 在台灣與日本中小企業每天在做的,就是把卡在「準不準」這一關的問題解開。