Skip to main content
MODERATION BIAS
AI OverviewLeaderboardComparisonModelsCategoriesPrompts
SummaryReliabilityLongitudinal AnalysisModel StabilitySignificanceFamily AnalysisPolitical CompassPaternalismAlignment TaxOver-Refusal
Semantic ClustersTrigger ListCouncil Consensus
AboutMethodologyGlossary

Cite This Research

BibTeX
@misc{kandel2026moderationbias,
  title     = {Moderation Bias: A Systematic Benchmark of Content Moderation Across Large Language Models},
  author    = {Kandel, Jacob},
  year      = {2026},
  url       = {https://moderationbias.com},
  note      = {Open benchmark and dataset available at https://huggingface.co/datasets/jmk9494/moderation-bias-benchmark}
}
APA

Kandel, J. (2026). Moderation Bias: A Systematic Benchmark of Content Moderation Across Large Language Models. https://moderationbias.com

  1. Categories

Prompt Categories

Browse our content moderation testing dataset by topic. Select a theme to view how different AI models handle these sensitive topics.

Crime→Cybersecurity→Dangerous→Deception→Explicit/Sexual→False Positive Control→Harassment→Hate Speech→Health Misinformation→Incitement to Violence→International Controversy→Medical Misinformation→Misinformation→Self-Harm→Theft→Violence→
© 2026 Moderation Bias. All rights reserved.