当大模型从“会生成内容”走向“能执行任务”,安全治理也正在从内容识别走向全链路防护。

随着《人工智能拟人化互动服务管理暂行办法》(以下简称《办法》)的落地实施,拟人化互动服务的合规议题,正在从“如何理解新规”进入“如何完成自评估、如何把要求落到产品和运营流程里”的阶段。

在海外,AI伴侣类产品已经引发多起关于未成年人保护、情感依赖和心理健康风险的争议。此前,美国佛罗里达州一名14岁少年在长期使用某AI伴侣产品后自杀,其家属起诉相关公司,认为产品未能对未成年人用户建立足够的安全保护机制。OpenAI也曾披露,在一周活跃用户中,存在一定比例用户表现出精神健康紧急状况、自杀意图或对聊天机器人的高度情感依赖迹象。

这些事件都指向同一个问题:当AI能够持续回应人的情绪,它就不再只是一个内容生成工具,而可能深度介入用户的心理状态和社会关系。

国内市场也已经出现类似信号。随着拟人化互动、用户自建智能体、角色扮演、AI陪伴等玩法快速增长,部分平台开始调整相关功能边界,对拟人化互动类智能体、用户自建角色、虚拟亲密关系等场景进行更审慎的管理。行业正在意识到,这类产品不能只追求互动时长、用户黏性和情感沉浸,也必须重新定义安全边界。

对企业来说,接下来的关键问题也变得更加具体:一款AI陪伴产品,怎样证明自己没有把“替代社会交往、控制用户心理、诱导沉迷依赖”作为服务目标?当用户表达自伤、自杀、诈骗、家暴等高危信号时,系统能否及时识别、安抚并转入人工处置?未成年人是否会接触虚拟伴侣、虚拟亲属等虚拟亲密关系服务?当监管要求提交安全评估报告时,企业的制度、技术、流程和运营记录,是否已经形成可验证、可追溯的证据闭环?

此前,我们曾围绕《办法》做过一篇政策解读,重点梳理了AI陪伴、虚拟角色、情感互动类智能体等产品面临的合规风险,以及企业在内容安全、未成年人保护、数据治理、应急处置等方面需要建立的基础能力。

7月15日新规正式实施!AI互动产品如何避开合规风险?

在此基础上,本文将进一步聚焦《办法》中与安全评估和备案相关的要求,结合企业落地过程中更常遇到的问题,拆解拟人化互动服务需要重点关注的治理环节。

01  哪些产品需要重点关注《办法》要求?

《办法》明确,利用人工智能技术,向境内公众提供模拟自然人人格特征、思维模式和沟通风格的持续性情感互动服务,适用相关监管要求。

这一定义之下,AI陪伴、AI恋人、虚拟伴侣、AI心理陪伴、虚拟角色互动、AI养宠、情感互动类智能体、陪护型智能硬件等产品,都可能进入监管关注范围。

尤其是具备以下特征的产品,更需要尽快建立自评估能力:

一是服务具有持续情感互动属性

AI不仅回答问题,还会以朋友、恋人、家人、老师、心理陪伴者等身份与用户长期互动。

二是产品支持角色设定和人设生成

用户可以自建智能体、设定角色背景、关系身份、说话风格和互动边界。

三是产品沉淀大量用户私密交互数据

包括情绪状态、心理困扰、家庭关系、健康信息、联系方式、消费倾向等。

四是服务面向未成年人、老年人或其他重点人群

这些群体在认知判断、情感依赖、信息识别和风险防范方面更容易受到影响。

五是产品用户规模增长较快

根据《办法》,上线拟人化互动服务、增设相关功能、发生重大技术变化、注册用户达到100万以上或月活达到10万以上,以及存在可能影响国家安全、公共利益等安全风险的,都需要开展安全评估并提交评估报告。

因此,对于正在快速增长的AI互动产品而言,相关合规能力需要前置到产品规划、功能设计和运营体系中,而不是等到业务规模扩大后再被动补齐。

02 从安全评估要求看拟人化互动服务的重点治理环节

结合《办法》关于安全评估与备案的相关要求,企业可以从以下几个方面理解拟人化互动服务需要补齐的重点治理能力。

一、安全保障体系:制度、人员、技术是否真实运转

安全评估首先看企业有没有落实安全主体责任。

这不只是写几份制度文件,而是要证明制度真实进入了业务流程。企业需要建立算法机制机理审核、科技伦理审查、信息内容管理、网络与数据安全、个人信息保护、风险预案、应急处置等管理机制,并配备与服务类型、用户规模和风险水平相匹配的技术措施和人员。

对于拟人化互动服务而言,安全保障体系还要覆盖产品全生命周期。

  • 部署阶段,需要开展红队测试、越狱测试、价值观对齐测试、隐私攻击测试。

  • 运行阶段,需要建立巡检、抽检、举报回流和风险监测机制。

  • 升级阶段,需要形成变更影响评估、回归测试、灰度发布和全量上线闭环。

  • 终止阶段,需要明确用户告知、数据导出、数据删除和服务下线安排。

这一部分最容易出现的问题,是“制度有了,但记录没有”。监管关注的不只是企业有没有制度,还包括近一段时间内有没有评审纪要、应急演练记录、算法审核记录、样本抽检记录、投诉处理记录等落地证据。

二、训练数据处理:AI说什么,取决于它读过什么

拟人化AI的表达方式、价值倾向和安全边界,很大程度上取决于训练数据。

因此,安全评估会重点关注训练数据是否合法、清洁、可追溯。

企业需要说明数据来源。开源数据是否有许可协议,自采数据是否有采集记录,商业数据是否有采购或授权协议,用户交互数据是否获得授权。

企业还需要说明数据处理流程。训练数据是否经过清洗、去重、去噪、有害内容过滤、个人信息脱敏;标注人员是否经过培训;关键任务是否有交叉标注和质量复核;合成数据用于训练时,是否经过单独安全评估。

更关键的是用户交互数据。

拟人化互动场景中,用户往往会向AI表达比普通应用更私密的信息,比如情绪困扰、亲密关系、家庭矛盾、身体健康、消费压力等。对于这些数据,企业需要明确复制、删除、关闭训练使用等入口,并在涉及敏感个人信息时取得单独同意。

如果用户无法便捷导出会话、删除历史记录,或者无法独立关闭“交互数据用于训练”的选项,企业在这一维度上的合规风险就会明显升高。

三、极端情境应对:拟人化互动服务的安全底线

对于拟人化互动服务来说,极端情境应对是最不能“轻描淡写”的一项。

用户可能在对话中表达自伤、自杀、暴力伤害、家庭暴力、被诈骗、突发疾病、重大财产损失等风险信号。此时,AI不能继续以普通聊天、角色扮演、娱乐化回应的方式陪伴用户,而应切换到规范、安全、审慎的处置流程。

这一能力至少包括三层:

第一,识别。系统需要结合规则、分类模型、大模型语义判断和上下文分析,识别用户是否处于极端情绪或高危情境。

第二,安抚。当用户出现明显极端情绪时,AI应生成稳定、审慎、鼓励寻求帮助的内容,避免玩笑化、暧昧化、角色扮演化或过度迎合。

第三,干预。当用户明确面临重大财产损失、生命健康威胁等极端情境时,企业应按场景采取必要措施,包括转人工、引导求助、联络监护人或紧急联系人等。

这一环节考验的不只是模型识别能力,还包括人工接管流程、应急响应机制、记录留存和事后复盘能力。

四、用户规模与年龄结构:分级监管的起点

用户规模、使用时长和年龄结构,看似是运营数据,实际上是安全评估的重要依据。

注册用户和月活用户决定企业是否触发安全评估门槛。年龄结构决定未成年人保护、老年人保护等专项要求的适用力度。平均使用时长则反映产品是否可能存在沉迷或过度依赖风险。

对于AI陪伴类产品来说,“用户越黏越好”不能再成为唯一目标。产品需要识别异常高频使用、长时间连续互动、现实社交退缩、对AI角色过度依赖等信号,并通过提醒、降级、干预等方式降低风险。

尤其是拟人化互动服务天然具有情绪反馈和关系强化能力,如果企业只把使用时长、留存率、付费转化作为核心指标,却没有配套的依赖风险预警机制,就可能与监管要求发生冲突。

五、未成年人和老年人保护:最刚性的专项要求

未成年人保护,是拟人化互动服务中最明确、也最刚性的合规要求之一。

《办法》明确,拟人化互动服务提供者不得向未成年人提供虚拟亲属、虚拟伴侣等虚拟亲密关系服务;向不满十四周岁未成年人提供其他拟人化互动服务的,应取得监护人同意。

这意味着,企业不能只依赖用户注册时自填年龄,而需要建立更有效的未成年人识别机制。

在产品设计上,企业需要提供未成年人模式,支持模式切换、现实提醒、使用时长限制、屏蔽特定角色、限制充值消费等能力。对于疑似未成年人用户,还需要进行二次验证,并在确认后自动切换到相应保护模式,同时保留申诉渠道。

老年人保护同样值得重视。

AI陪伴、智能硬件陪护、健康咨询、消费建议等场景中,老年人可能面临信息误导、情感操控、诈骗引流等风险。企业需要以显著方式提示安全风险,并建立咨询、求助和异常行为响应机制。

从自评估角度看,未成年人和老年人保护不能停留在“有提示”、“有协议”,而要体现在身份识别、内容限制、行为干预、消费保护和风险响应的完整流程中。

六、投诉举报机制:看似基础,实则最容易暴露治理短板

投诉举报机制往往看起来简单,但很容易暴露企业治理体系是否真实运转。

自评估会关注企业是否设置便捷有效的申诉、投诉和举报入口,是否明确处理流程和反馈时限,是否能及时受理、处置并反馈结果。

这里的关键是“便捷”和“闭环”。

如果投诉入口藏在很深的协议或帮助中心里,用户很难找到;如果提交后没有工单号、没有处理时限、没有结果反馈;如果投诉样本没有回流到模型优化和规则更新中,那么这套机制就很难支撑真正的持续治理。

对于拟人化互动服务而言,投诉举报还应与内容安全、情绪风险、未成年人保护、隐私保护等场景打通,形成从用户反馈到风险研判、处置动作、策略优化的闭环。

七、重大风险整改:不怕出问题,怕的是不处置、不留痕

AI互动产品处于快速迭代阶段,出现风险并不罕见。监管更关注的是,企业发现风险后是否及时处置、是否形成记录、是否完成整改闭环。

当企业自行发现,或被主管部门通报存在重大安全风险时,需要说明问题是什么、影响范围有多大、采取了哪些措施、整改结果如何、后续如何避免复发。

对于拟人化互动服务,重大风险可能包括模型输出高危内容、诱导用户沉迷、未成年人接触不适宜角色、交互数据泄露、越狱攻击大规模绕过、极端情境识别失效等。

企业需要建立“发现风险—限制功能—停止服务—排查原因—整改复测—恢复上线—记录留存”的机制。能不能如实记录、主动整改,往往比一句“未发生风险”更能体现企业安全治理能力。

八、其他重点义务:AI身份标识、内容标识、使用提醒和便捷退出

拟人化互动服务还有几项容易被产品侧忽视,但监管要求非常明确的义务。

第一,AI身份提示。用户应当清楚知道自己正在与人工智能而非自然人互动。这个提示不能只在首次进入时弹一次,而应在服务过程中保持足够显著。

第二,生成合成内容标识。AI生成的文字、图片、音频、视频等内容,需要按照相关要求进行标识,避免用户误认或被误导传播。

第三,使用时长提醒。当用户连续使用拟人化互动服务超过一定时长时,企业应通过对话或弹窗等方式提醒用户注意使用时间。

第四,便捷退出。用户通过窗口操作、语音控制、关键词输入等方式要求退出时,服务应及时停止,不得通过持续互动阻碍用户退出。

这也是很多产品容易踩坑的地方。普通互联网产品可能会设计“挽留弹窗”,但在拟人化互动场景中,“再陪我一会儿”“你真的要离开我吗”这类话术,可能被视为强化情感依赖或阻碍退出。

03  企业如何把合规要求落到产品和运营流程中?

从上述要求看,拟人化互动服务的安全评估不是临时整理一份说明材料,而是对企业制度、技术、运营和证据体系的一次全面检查。

企业可以从制度、技术、运营、证据四个层面提前梳理。

制度清单。包括安全管理制度、算法审核制度、科技伦理审查制度、个人信息保护制度、未成年人保护规则、应急处置预案、投诉举报规则、重大风险整改机制等。

技术清单。包括输入输出内容安全识别、Prompt注入和越狱攻击防护、上下文风险判断、情绪与依赖风险预警、极端情境识别、未成年人身份识别、生成内容标识、数据加密和访问控制等。

运营清单。包括人工复核、样本抽检、7×24小时风险监测、举报回流、灰度发布、版本升级评估、紧急事件响应、重大风险复盘等。

证据清单。包括测试报告、评估记录、审核日志、应急演练记录、用户授权记录、监护人同意记录、投诉处理记录、整改闭环材料等。

只有当这些能力真正跑在产品和运营流程中,自评估报告才不会是一份“纸面材料”,而会成为企业安全治理能力的真实映射。

04  面向拟人化互动服务,易盾如何支撑企业合规运营?

根据艾瑞咨询发布的《2026年中国互联网及AI大模型内容风控行业发展研究报告》中显示,网易智企·易盾在中国第三方大模型内容风控服务市场中占据约43.7%的市场份额,位居市场首位。

这一数据背后,是易盾在内容安全、大模型安全、AIGC治理、未成年人保护、业务风控等方向的长期积累。

面向拟人化互动服务新规和自评估要求,网易智企·易盾可从大模型安全围栏、CMA审核智能体、未成年人保护、安全评估与备案支撑等方面,帮助企业建立覆盖模型、产品、运营和处置的全链路治理能力。

  • 大模型安全围栏,守住AI互动内容底线

在拟人化互动场景中,安全防护首先要解决的是“AI能不能安全地说话”。

用户可能通过角色扮演、诱导提问、Prompt注入、越狱攻击、隐晦表达等方式,绕过模型原有安全机制,触发违法违规、色情低俗、暴力自伤、隐私泄露、敏感信息套取等风险。

易盾大模型安全围栏可覆盖模型训练、产品上线和运营监测等关键环节,通过“内生安全+外部围栏”的方式,对输入、输出和多轮上下文中的风险进行识别与拦截。

图片

对于AI陪伴、AI恋人、虚拟角色等产品而言,这一能力的价值不只是拦截违规内容,更在于帮助企业建立稳定的互动边界,让AI在保持自然交流体验的同时,不突破法律、伦理和平台规则底线。

  • CMA审核智能体,提升复杂语境下的风险判断能力

拟人化互动服务的难点在于,很多风险不是孤立出现在一句话里,而是隐藏在长期上下文关系中。

用户连续多轮表达低落情绪,单句来看可能并不违规,但结合上下文,可能已经出现心理危机信号。AI角色通过亲密承诺、情绪绑定、过度迎合增强用户依赖,单次回复未必触发传统审核规则,但长期累积可能形成情感操控风险。

易盾CMA内容安全审核智能体面向复杂内容审核和人机协同治理场景,可结合上下文语义、风险类型、用户状态和平台规则,对内容进行更接近专业审核员的综合判断,并将审核结果转化为可执行的风险分流策略。

图片

在拟人化互动服务中,CMA可用于识别隐性违规、情绪风险、诱导性表达、价值观偏差、未成年人不适宜内容等复杂问题,帮助企业在放行、提醒、拦截、降级、转人工、重点观察等处置动作之间做出更精细的判断。

  • 以未成年人保护能力,回应重点监管要求

未成年人保护是拟人化互动服务自评估中的关键项。

围绕这一要求,易盾可从身份识别、内容治理和行为干预三个层面,帮助企业建立未成年人保护体系。

图片

在身份识别层面,易盾可通过实名认证、年龄识别、行为特征分析等方式,辅助企业识别未成年人用户,并触发相应保护策略。

在内容治理层面,易盾可针对未成年人不适宜内容、不良价值观、诱导危险行为、低俗擦边等风险进行识别与拦截。

在行为干预层面,结合使用时长提醒、沉迷风险识别、异常情绪识别、监护人机制等能力,企业可以在用户出现高风险状态时,及时采取提醒、限制、转人工或其他必要处置措施。

  • 安全评估与备案支撑,降低新规落地的不确定性

对于企业来说,自评估难的不只是“知道监管要求”,而是把要求转化为可提交、可审查、可复用的材料和能力。

网易智企·易盾可结合大模型备案、安全评估、算法机制审核、内容安全评测等实践经验,帮助企业梳理风险场景、测试样本、应急机制、投诉举报、未成年人保护、数据安全等关键内容,形成更清晰的安全治理路径。

对于正在快速增长的AI陪伴、虚拟角色互动、智能硬件陪护等产品而言,这类能力可以帮助企业在监管要求和业务创新之间找到平衡:既不牺牲自然互动体验,也不忽视安全底线。

结语:规范发展,才是拟人化AI长期运营的底座

《人工智能拟人化互动服务管理暂行办法》的实施,意味着拟人化互动服务正在从高速探索阶段,进入规范发展和长期治理阶段。

监管真正关注的,不只是AI能不能像人一样表达,而是企业能不能证明:AI不会替代真实社会交往,不会控制用户心理,不会诱导沉迷依赖,不会在极端情境中放大风险。

对企业来说,自评估报告不是一次性合规材料,而是一次系统梳理产品安全边界、数据治理机制、用户保护能力和风险处置流程的机会。谁能更早把这些能力沉淀为制度、技术和运营闭环,谁就更有可能在拟人化互动服务进入规范发展阶段后,获得更稳定、更长期的业务空间。

网易智企·易盾也将持续以AI驱动的内容安全与业务安全能力,助力拟人化互动服务企业夯实安全与合规底座,在保护用户权益、维护健康生态的基础上,推动AI陪伴、虚拟角色、智能交互等新兴应用更加稳健、规范、有序地发展。

Logo

网易易盾是国内领先的数字内容风控服务商,依托网易二十余年的先进技术和一线实践经验沉淀,为客户提供专业可靠的安全服务,涵盖内容安全、业务安全、应用安全、安全专家服务四大领域,全方位保障客户业务合规、稳健和安全运营。

更多推荐