在人工智能应用日益广泛的今天,如何确保大模型输出的安全性和可靠性成为行业关注的焦点。传统方案多采用独立的外置护栏模型,对输入或输出内容进行审核。这种方法虽然直接有效,但需要额外处理待审核内容,增加了计算和部署成本。更关键的是,若在完整回答生成后再进行检查,风险内容可能已暴露给用户;若频繁检查,又会加重系统运行负担。
针对这一难题,蚂蚁AI安全实验室近日推出创新解决方案——大模型内生式安全护栏SingProbe。该技术通过复用大模型推理过程中已产生的内部信息,利用轻量化安全检测模块持续输出风险分数,实现安全判断与内容生成的同步进行。这种设计使得模型在生成回答的同时,就能实时评估内容是否存在安全风险或事实可靠性问题,为系统提供及时干预的依据。
以医疗咨询场景为例,当用户询问健康问题时,系统需要防范AI给出不恰当的用药建议;在资料查询场景中,则要警惕AI编造不存在的文献或事实依据。SingProbe能够在回答生成过程中持续监测风险,一旦检测到异常信号,系统可立即采取中止回答、重新生成等措施,有效避免风险内容传播。这种动态防护机制显著提升了AI应用的安全性。
技术实现层面,SingProbe突破了传统外置护栏的局限。通过内部信息复用,它无需额外处理待审核内容,既降低了计算成本,又实现了实时风险评估。轻量化检测模块的设计确保了系统运行效率,使安全防护与模型生成无缝衔接。这种内生式安全架构为AI应用提供了更高效、更可靠的保护方案。
目前,SingProbe已完成对29个主流开源大模型的适配,包括Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等,并接入SGLang、vLLM推理框架。为推动技术普及,研发团队同步开源了相关代码、模型和评测基准,供全球开发者参考使用。这一举措将加速内生式安全技术在AI领域的落地应用,为构建更安全的AI生态系统奠定基础。










