服務內容

內部表徵工程

觀察模型不同層的內部活動,尋找與目標行為相關的候選方向,再以對照樣本和干預實驗驗證關聯。候選方向只反映指定模型及樣本下的觀察結果,不代表可跨模型直接重用的通用機制。

拒答方向分析

在合法授權及受控環境下,分析模型對不同請求的拒答模式,檢查候選方向、層位和樣本選擇如何影響結果。評測同時涵蓋正常請求被錯誤拒絕的情況,以及本應拒絕的高風險請求,避免只看單一指標。

拒答方向消除與權重層修改

可研究針對特定內部方向的定向消除或其他權重層修改,並保留原始權重、修改程式、版本及回退方法。這類改動可能影響安全邊界或損害通用能力;能否投入正式環境,必須由對照評測及客戶治理要求決定。

修改前後基準評測

固定模型版本、推理參數和測試數據,比較目標任務、通用能力、格式遵循、錯誤拒答率、高風險請求處理、穩定性及效能。報告列出分項結果、失敗個案、結果波動和已知限制,不以單一展示題目證明修改有效。

若實驗涉及安全行為變化,須先在隔離環境驗證,明確可存取人員、用途及發布審批責任。公開發布或正式部署不屬於預設實驗範圍,需另行確認。

如何開始

請提供可修改的模型版本、期望改善的具體行為、已去識別化的樣本,以及不可退化的能力與安全要求。我們會先提出實驗設計和對照指標,再判斷是否需要修改權重。

相關服務:模型後訓練 · 企業大模型私有化部署