服务内容

内部表征工程

观察模型不同层的内部活动,寻找与目标行为相关的候选方向,并通过对照样本和干预实验验证关联。候选方向只说明在给定模型与样本上的观察结果,不直接代表可跨模型复用的通用机制。

拒答方向分析

在合法授权和受控环境下,分析模型对不同请求的拒答模式,检查候选方向、层位和样本选择对结果的影响。评估既覆盖合理请求被误拒的情况,也覆盖本应拒绝的高风险请求,避免只看单一指标。

定向去除与权重级修改

可研究针对特定内部方向的定向去除或其他权重级修改,保留原始权重、修改脚本、版本和回退路径。该类改动可能改变安全边界或损害通用能力,是否适合生产使用必须由对照评测和客户治理要求决定。

修改前后基准评测

固定模型版本、推理参数和测试数据,对比目标任务、通用能力、格式遵循、误拒率、高风险请求处理、稳定性与性能。报告列出分项结果、失败样本、结果波动及已知限制;不以单个演示问题证明改造有效。

若实验涉及安全行为变化,先在隔离环境验证,明确可访问人员、用途和发布审批责任。公开发布或生产部署不包含在默认实验范围内,需要单独确认。

适合下一步怎么谈

请提供可修改的模型版本、希望改善的具体行为、可分享的脱敏样本,以及不能退化的能力和安全要求。我们先给出实验设计和对照指标,再判断是否需要改权重。

相关服务:模型后训练 · 企业大模型私有化部署