返回知識庫

Knowledge

怎樣評估 LLM 應用:由示範走向量產

Evaluating LLM apps: from demo to production

本日瀏覽 · 0 · 累計瀏覽 · 0
  • 評測
  • 品質
  • 生產
  • MLOps

示範階段可用幾條「金鑰問題」;量產需要更大測試集,涵蓋邊界情況與失敗模式。

分開追蹤:事實正確性、格式正確、語氣合規、延遲與成本——每項有不同量測方式。

線上環境可記錄使用者修正、點讚/投訴與人工覆核比例,作為下一輪迭代依據。

對 AutoChat:金鑰問題包括「而家開唔開」「預約星期六三點」「冇寫嘅療程點答」。最後一條應該轉交店員,而唔係編造。

對 AdReel:除「有冇片出街」,仲要睇人審退回率、音樂/面孔風險、以及額度有冇喺預期內燒完。

官網控制台示範數據唔可以當評測。評測要用你自己嘅真實後台同固定題庫,否則會把樣本指標誤當成 SLA。

為這篇文章評分(1–5 星)