ToolPicker
Mistral Moderation API

Mistral Moderation API

33/100

Multilingual LLM-based moderation classifier, 9 policy categories.

docs.mistral.ai

// scorecard · 33/100

verified 1mo ago
methodology →
Agent-readiness11/35
Agent registration (api_key)6/9
Public API5/5
OpenAPI spec0/9
MCP server0/9
llms.txt0/3
Reliability & performance0/15
Actively maintained
Production-ready0/4
Updated recently
Pricing6/13
Itemized public pricing0/6
Free tier / trial4/4
Free-tier generosity2/3
Docs & DX2/12
Docs quality
Public API2/2
Quickstart / examples0/2
Security & compliance10/12
SOC 26/6
ISO 270012/2
GDPR0/2
Security / trust page2/2
Openness4/10
Open source0/6
Open / un-gated API4/4
Company maturity0/3
Company size
Years operating

// rankings · cost per standard workload

Token-priced ($0.10/1M input); per-item cost depends on item length — not computable without assumption

mistral.ai/pricing

// overview

The Moderation API classifies text across policy categories including Sexual, Hate and Discrimination, Violence and Threats, and jailbreaking using the mistral-moderation-2603 model. It provides two endpoints (raw-text and conversational) that accept single strings or lists of strings and return category scores for custom pipelines. The service is positioned alongside Custom Guardrails for production LLM guardrailing.

Best for: Custom pipelines needing raw category scores and full threshold control

// security & compliance

SOC 2 ISO 27001 GDPR HIPAA

// features

  • Classifies raw text or conversational content
  • Detects Sexual, Hate/Discrimination, Violence/Threats categories
  • Includes jailbreaking category
  • Raw-text endpoint accepts single string or list of strings
  • Conversational endpoint for chat-style input
  • Returns category scores for user-defined thresholds

sources