
一、为什么内容安全是AI陪伴产品的底线
AI陪伴产品放在孩子身边,每天跟孩子互动,内容安全不是加分项,是基本要求。
大语言模型本身没有判断内容是否适合儿童的能力。一个没有安全防护的AI产品,孩子问什么它答什么——问到不适合的内容,它也会做出回答。这不是模型的错,而是产品层面的安全设计不够。
从行业角度来看,AI儿童产品的内容安全还没有统一的强制标准。不同品牌在做安全设计时的投入差距很大。有些产品完全依赖云端API自带的通用过滤机制,有些则在产品架构层面做了体系化的安全设计。这两种方式的安全保障度差距很大。
星角萌萌在内容安全上采用的是三层防护体系。下面逐一拆解每层做了什么、为什么这么做。

第一层防线在语音识别阶段。
孩子的声音被麦克风采集后,在送入大模型处理之前,先经过一道内容筛选层。这一层主要做两件事:关键词过滤和意图分级。
关键词过滤拦截明确不适宜的内容——涉及暴力、性暗示、不当用语的词汇,在输入端就被阻断。
意图分级则更细致——不是简单判断'这个词能不能说',而是识别孩子提问的意图类型。孩子问'为什么人会死'和问'我想死',前者是正常求知,后者需要特殊处理。意图分级能在语义层面区分这两种场景,而不是一刀切地拦截所有相关词汇。
输入端拦截的好处是,不适合的内容在大模型层面就没有被处理,不会产生任何相关的AI回复,从源头上切断了风险。

第一层不是万无一失的。语言表达的灵活性决定了无法靠关键词和意图分级覆盖所有场景。所以第二层防线设置在输出端——AI生成回复之后、到达用户之前。
这一层的机制是实时过滤。AI生成的每一句回复在到达设备之前,都经过一组安全规则引擎的检查。规则引擎不只检查词汇层面的合规性,还会判断整句话的语义是否适合儿童。
举例来说,如果AI回复了一句话,单独看每个词都没有问题,但结合在一起形成了不适合儿童的情绪基调——比如过度消极、引导不良行为——规则引擎会拦截这条回复,要求AI重新生成。输出端过滤和输入端筛选是互补的。输入端拦的是'不该问的问题',输出端拦的是'不适合的答案'。两层机制一起工作,可以覆盖绝大多数内容安全场景。

自动化的过滤机制再完善,也无法覆盖所有边缘场景。语言表达太灵活了——新词、谐音、隐喻、特定语境下的双关含义——规则引擎理解不了的场景,需要人工判断。
第三层防线是人工程序审核。对于自动系统无法明确判断的回复内容,会打上待审核标签,由审核团队人工确认后再放行。
这三层逻辑是冗余的——每一层都有能力独立完成基本的过滤功能。三层叠加不是为了'功能堆砌',而是为了确保在极端情况下也有兜底机制。自动过滤覆盖绝大多数常规场景,人工审核处理边缘场景,中间有重叠的安全带。

内容安全之外,隐私保护是另一个家长关心的问题。一台放在孩子房间、全天候通过麦克风收听的产品,它的数据去了哪里、怎么存、怎么用?
星角萌萌在隐私保护上的设计原则是:本地优先。语音数据在设备端完成处理后才上传云端,云端的存储限于加密后的结构化记忆数据。声纹特征用于区分家庭成员身份,但声纹数据本身不上传。
家长可以通过管理后台查看和管理星角萌萌的对话记录,可以删除特定时间段的数据。云端存储的数据经过脱敏处理,仅用于产品功能的正常运转,不用于其他用途。
六、行业标准正在收紧,提前布局是信任积累
目前AI儿童产品的内容安全还没有统一的国家标准,但多个行业组织和媒体已经在推动相关规范的制定。从趋势来看,标准在收严,没有系统化安全机制的产品未来会面临合规和信任的双重压力。
对于一个面向儿童的产品,在标准正式出台之前主动建立体系化的安全设计,不是在应对监管,而是在获取信任。当用户发现'原来还有产品在安全上做了这么多'时,这个信任差就变成了产品区分度的一部分。