为解决大模型输出内容存在违规、偏见、敏感信息泄露等风险,搭建 AI 对话安全护栏网页端系统,目标是在用户与大模型交互全流程做内容管控,实现输入检测、输出过滤、风险拦截,保障大模型应用安全合规使用。系统核心模块包含对话交互模块、安全护栏网关模块、会话管理模块、风险日志审计模块。对话交互模块提供聊天界面,支持流式输出展示大模型返回结果;安全护栏网关负责对用户提问和模型回复进行多维度内容审核,识别暴力、色情、政治、隐私泄露类风险;会话管理维护多轮对话上下文,支持新建、切换、删除会话;风险日志审计记录每轮对话风险标签、拦截结果,便于追溯复盘。业务流程:用户在页面输入提问,请求先经过安全护栏网关校验输入内容,若命中风险规则直接拦截并返回提示;输入安全则转发给大模型服务获取流式回答,模型返回内容再次经过输出侧安全检测,过滤风险片段后,将安全内容流式渲染到前端页面,产生风险的对话完整记录存入审计日志。