Mistral Moderation API
33/100Multilingual LLM-based moderation classifier, 9 policy categories.
docs.mistral.ai// scorecard · 33/100
verified 1mo agoAgent-readiness11/35
Agent registration (api_key)6/9
Public API5/5
OpenAPI spec0/9
MCP server0/9
llms.txt0/3
Reliability & performance0/15
Actively maintained—
Production-ready0/4
Updated recently—
Pricing6/13
Itemized public pricing0/6
Free tier / trial4/4
Free-tier generosity2/3
Docs & DX2/12
Docs quality—
Public API2/2
Quickstart / examples0/2
Security & compliance10/12
SOC 26/6
ISO 270012/2
GDPR0/2
Security / trust page2/2
Openness4/10
Open source0/6
Open / un-gated API4/4
Company maturity0/3
Company size—
Years operating—
// rankings · cost per standard workload
#13 in Content Moderationnot comparable
Token-priced ($0.10/1M input); per-item cost depends on item length — not computable without assumption
mistral.ai/pricing// overview
The Moderation API classifies text across policy categories including Sexual, Hate and Discrimination, Violence and Threats, and jailbreaking using the mistral-moderation-2603 model. It provides two endpoints (raw-text and conversational) that accept single strings or lists of strings and return category scores for custom pipelines. The service is positioned alongside Custom Guardrails for production LLM guardrailing.
Best for: Custom pipelines needing raw category scores and full threshold control
// security & compliance
✓ SOC 2✓ ISO 27001✗ GDPR✗ HIPAA
// features
- Classifies raw text or conversational content
- Detects Sexual, Hate/Discrimination, Violence/Threats categories
- Includes jailbreaking category
- Raw-text endpoint accepts single string or list of strings
- Conversational endpoint for chat-style input
- Returns category scores for user-defined thresholds