UGC 创作平台罗布乐思(Roblox)将三款升级后的 AI 安全模型,对外开源并提交至稳健开放网络安全工具社区 ROOST。
罗布乐思在 2025 年初就已经成为 ROOST 创始成员,谷歌、OpenAI 同样是该组织的发起方,致力于向全行业输出免费线上安全技术底座。

本次开放的工具套件包含升级后的个人可识别信息分类器 PII Classifier、风险预警系统 Roblox Sentinel,以及第三代语音安全分类器。平台内部已经上线这些模型,用于识别隐私信息泄露、预判儿童安全风险、实时审核语音聊天内容。
罗布乐思还同步放出一套全新基准评测数据集,可供其他企业用来测试、调校自家的内容审核系统。
新版个人可识别信息分类器不再只看单句文本,会结合完整对话上下文做判断。可以捕捉拼写篡改、暗语、隐晦指代等各类绕过过滤的手段。
该模型语言支持规模迎来巨大飞跃,从原先 17 种扩充至 189 种语言,F1 综合评分由 63.41 大幅提升到 90.52,检测能力显著增强。
Roblox Sentinel 主打潜在儿童受侵害风险的早期预警,不等对话出现明确违规内容,就识别出潜藏的危险沟通模式。截至 2026 年 8 月过去十二个月,平台近 70% 儿童风险案例,都是依靠这套系统提前发现识别出来的。
第三款是第三代语音安全分类器,覆盖 30 种语言,能够识别八大类语音违规内容。在 1% 低误报率前提下,模型可以实现 61% 的违规内容召回率,适配实时语音场景的运行要求。
配套发布的基准数据集,由大量模拟多人对话样本构成,专门复刻各类规避隐私过滤器的花式手段,给全行业提供统一的测试标尺。
罗布乐思表示,把安全模型开源,是希望中小平台不用从零搭建审核体系,可以直接拿到成熟的技术起点。同时平台自身也能够吸收其他企业使用后的反馈,持续迭代安全能力。
儿童网络安全一直是罗布乐思绕不开的议题,平台多次遭遇监管问询与相关诉讼。对外开源安全工具,也是平台对外展示安全技术积累的重要方式。
不过官方也提示,AI 工具无法做到百分百准确,机器识别依旧需要搭配人工复核,线上安全需要整个行业共同协作推进。









