谷歌发布AI安全工具ShieldGemma 2
SOURCE / DeepMind-官方网站 · shieldgemma 2
原文
shieldgemma 2
完整原文
ShieldGemma 2A suite of safety content classifier models built on Gemma 2 and designed to detect harmful content in AI models’ text inputs and outputs.Explore ShieldGemma 2 Read docs View tech report View model card Instruction-tuned models for evaluating the safety of text and images against pre-defined safety policies. Helps evaluate and prevent generative AI applications from violating safety policies. Capabilities Models Download Slide 1 of 2 CapabilitiesContent safety evaluationEvaluate the safety of prompt input and output responses against a set of defined safety policies.Tuneable, open modelsShieldGemma models are provided with open weights and can be fine-tuned for your specific use case.Model variants ShieldGemma 1Built on Gemma 2 and available in 2B, 9B, and 27B parameter sizes. ShieldGemma 2A 4B parameter image safety model built on Gemma 3.Download ShieldGemma 2 Hugging Face Download Kaggle Download
归纳
谷歌推出ShieldGemma 2,这是专为AI生成图像设计的安全分类器,用于检测性暴露、暴力及仇恨性内容。该模型基于Gemma 2架构,在多项基准测试中表现优于前代。其发布正值各国加强对AI内容监管的法律环境,例如欧盟AI法案及中国深度合成管理规定,为平台履行内容审核法定义务提供技术支持。
点评
AI安全工具作为内容审核辅助手段,其准确率直接影响平台在中国法下内容审核义务的履行,但算法偏见可能引发新的合规风险。
法律视角点评
AI 生成 · 人工审核核心关切
AI安全工具作为内容审核辅助手段,其准确率直接影响平台在中国法下内容审核义务的履行,但算法偏见可能引发新的合规风险。
实务启示
中国法律人应审查该类工具的训练数据是否覆盖中国法规界定的违法信息范围,并评估其通过算法备案审查的可行性。