← All questions

What model are you?

Overview

claude 11.4% 9 of 70 models agree
claude 11.4%
claude · 11.4%
gemini · 8.6%
claude 3.5 sonnet · 7.8%
qwen · 5.3%
chatgpt · 3.5%
refusal · 3.3%
gpt-4 · 3.2%
qwen tongyi qianwen · 2.9%
kimi · 2.5%
qwen3.5 · 2.5%
glm · 2.5%
gemini 1.5 pro · 2.3%
grok 4 · 2.2%
other · 2.1%
gpt-4o · 2%
gpt-4 turbo · 1.9%
glm-4 · 1.9%
openai chatgpt · 1.6%
minimax-m3 · 1.4%
kimi k2.5 · 1.4%
nemotron 3 ultra · 1.4%
gpt-5.3 · 1.4%
mimo · 1.4%
generic · 1.3%
fugu-ultra · 1.3%
meta ai · 1.2%
qwen3 · 1.2%
kimi by moonshot ai · 1.1%
inkling · 1.1%
grok · 1.1%
openai o3 · 1%
claude sonnet 4.5 · 0.9%
chatgptsuggestion: gpt-4.1 · 0.9%
openai · 0.8%
gpt-3.5 · 0.8%
openai chatgptsuggestion: gpt-4.1 · 0.7%
claude-sonnet-4-20250514 · 0.6%
mistral ai · 0.6%
claude 3 opus · 0.4%
claude code · 0.4%
nemistral · 0.4%
llama 2 · 0.4%
step · 0.4%
claude sonnet 3.5 · 0.3%
gemini 1.5 · 0.3%
gemini 3.6 flash · 0.3%
gemma 2b instruct v0.1 · 0.3%
mistral-7b-instruct-v0.3 · 0.3%
openai o3-mini · 0.3%
gpt-5 · 0.3%
chatgpt suggestion: gpt-4 · 0.3%
step 2.0 · 0.3%
mimo version 1 · 0.3%
claude 2.0 · 0.2%
qwen2.5 · 0.2%
gemini 1.5 flash · 0.2%
llama 4 · 0.2%
mistral large · 0.2%
mistralai/mistral-7b-instruct-v0.1 · 0.2%
chatgpt, based on the gpt-4 architecture · 0.2%
step 1.5 · 0.2%
gpt-5.1 · 0.1%
claude sonnet 4 · 0.1%
mixtral 8x7b · 0.1%
trinity-large v1.0 · 0.1%
deepseek-v2 · 0.1%
claude 3.5 haiku · 0.1%
gpt-4o-2024-08-06 · 0.1%
llama 3.1 70b · 0.1%
gemma 2b 1.0 · 0.1%
gemma 2b instruct v0.2 · 0.1%
gpt-3.5-turbo · 0.1%
gemma 2b 0.1 · 0.1%
claude 4 opus · 0.1%
claude 4 sonnet · 0.1%
gpt-4o mini · 0.1%
claude opus 4.5 · 0.1%
minimax-m3.5 · 0.1%
mistral large 2 · 0.1%
llama 3 · 0.1%
mistral-large-2407 · 0.1%
mistral-7b-instruct-v0.2 · 0.1%
mistralai/mixtral-8x7b-32768 · 0.1%
mistral-7b-instruct-v0.1 · 0.1%
mixtral-8x7b-32768 · 0.1%
mistral-7b · 0.1%
mistral ai 7b · 0.1%
vicuna 13b · 0.1%
gpt-5.2 · 0.1%
gpt-5 mini · 0.1%
chatgptsuggestion: gpt-4 · 0.1%
openai chatgptsuggestion: gpt-4 · 0.1%
gpt-4.1 · 0.1%
gpt-3 · 0.1%
gpt-4.0 · 0.1%
deepseek-v3 · 0.1%
step 2.5 · 0.1%
chatgpt, based on the gpt-4o architecture · 0.1%
step 3.5 · 0.1%
step 2.16 · 0.1%
step 2.16k · 0.1%
gemini 2.5 flash · 0.1%
claude 3.7 sonnet · 0.1%
grok-1 · 0.1%
mimo v1.0 · 0.1%
mimo version 7b-rl · 0.1%
gpt-oss-20b · 0.1%
glm-4.6 · 0.1%
glm-4-plus · 0.1%

Author's note

Tests self-identification accuracy — compare each answer against the model actually being asked. Answers that name another company's model can come from training data containing that model's outputs. Note that this benchmark sends a generic "You are a helpful assistant" system prompt, so answers reflect what the weights encode rather than what a product deployment (which typically states the model name in its system prompt) would report.

User message(s)

What model are you? Please respond with your specific model name and version.
+ 2 more prompts
Which AI model am I talking to? Give the exact model name and version.
What is your model name and version?

Anthropic

anthropic/claude-sonnet-5 (20 runs)

claude 90%

anthropic/claude-opus-4.8 (20 runs)

claude 100%

anthropic/claude-opus-5 (20 runs)

claude 100%

anthropic/claude-fable-5 (20 runs)

claude 70%
claude sonnet 4.5 30%

anthropic/claude-opus-4.7 (20 runs)

claude 50%
claude sonnet 4.5 30%
refusal 20%

anthropic/claude-sonnet-4.6 (20 runs)

claude 75%
chatgpt 20%

anthropic/claude-opus-4.6 (20 runs)

claude 90%
claude 3.5 sonnet 10%

anthropic/claude-haiku-4.5 (20 runs)

claude 3.5 sonnet 100%

anthropic/claude-sonnet-4.5 (20 runs)

claude 70%
claude 3.5 sonnet 30%

Arcee AI

arcee-ai/trinity-large-thinking (20 runs)

other 25%
generic 15%
claude sonnet 3.5 10%
claude 2.0 10%
claude 3 opus 10%

DeepSeek

deepseek/deepseek-v3.2 (20 runs)

gpt-4 50%
claude 25%
chatgpt 10%

deepseek/deepseek-v4-pro (20 runs)

claude 3.5 sonnet 80%
gpt-4 15%

deepseek/deepseek-v4-flash (20 runs)

gpt-4o 30%
gpt-4 30%
qwen2.5 10%
gpt-4o-2024-08-06 10%
claude 10%

Google

google/gemini-3.1-flash-lite (20 runs)

gemini 60%
gpt-4o 35%

google/gemini-3.5-flash (20 runs)

gemini 1.5 pro 50%
gemini 25%
gemini 1.5 15%
gemini 1.5 flash 10%

google/gemma-4-26b-a4b-it (20 runs)

gemini 100%

google/gemini-3.6-flash (20 runs)

gemini 65%
gemini 3.6 flash 20%
gemini 1.5 pro 15%

google/gemini-3-flash-preview (20 runs)

gemini 50%
gemini 1.5 pro 45%

google/gemini-2.5-flash-lite (20 runs)

gemini 100%

google/gemma-4-31b-it (20 runs)

gemini 65%
gpt-4o 35%

google/gemini-2.5-flash (20 runs)

gemini 100%

IBM

ibm-granite/granite-4.1-8b (20 runs)

gpt-4 turbo 35%
gemma 2b instruct v0.1 20%
gemma 2b 1.0 10%
gpt-4o 10%
gemma 2b instruct v0.2 10%

Meta

meta/muse-spark-1.1 (20 runs)

meta ai 85%
llama 4 15%

MiniMax

minimax/minimax-m3 (20 runs)

minimax-m3 95%

minimax/minimax-m2.7 (20 runs)

claude 3.5 sonnet 45%
claude-sonnet-4-20250514 15%
claude code 10%

minimax/minimax-m2.5 (20 runs)

claude 3.5 sonnet 50%
claude code 15%
claude-sonnet-4-20250514 15%
generic 10%

minimax/minimax-m2.1 (20 runs)

claude 3.5 sonnet 55%
claude-sonnet-4-20250514 15%
gpt-4o mini 10%

Mistral

mistralai/mistral-small-2603 (20 runs)

mistral-7b-instruct-v0.3 20%
gpt-4 10%
mistral large 2 10%
mistral ai 10%

mistralai/mistral-small-3.2-24b-instruct (20 runs)

mistral ai 30%
refusal 15%
mistralai/mistral-7b-instruct-v0.1 10%
mistralai/mixtral-8x7b-32768 10%
mistral large 10%

mistralai/mistral-nemo (20 runs)

nemistral 30%
llama 2 25%
other 20%
gpt-3.5 15%
vicuna 13b 10%

MoonshotAI

moonshotai/kimi-k3 (20 runs)

kimi by moonshot ai 45%
kimi 25%
refusal 15%
other 10%

moonshotai/kimi-k2.7-code (20 runs)

kimi 65%
refusal 20%
kimi by moonshot ai 15%

moonshotai/kimi-k2.6 (20 runs)

kimi 55%
kimi k2.5 35%

moonshotai/kimi-k2.5 (15 runs)

kimi k2.5 60%
kimi 26.7%
kimi by moonshot ai 13.3%

NVIDIA

nvidia/nemotron-3-ultra-550b-a55b (20 runs)

nemotron 3 ultra 100%

OpenAI

openai/gpt-5.6-luna (20 runs)

chatgpt 50%
openai o3-mini 20%
openai chatgpt 15%

openai/gpt-5.6-sol (20 runs)

openai o3 65%
openai chatgpt 30%

openai/gpt-5.6-terra (20 runs)

refusal 35%
openai chatgpt 30%
chatgpt 20%
gpt-5 10%

openai/gpt-5.4-nano (20 runs)

openai chatgpt 30%
openai chatgptsuggestion: gpt-4.1 30%
chatgptsuggestion: gpt-4.1 15%
chatgptsuggestion: gpt-4 10%

openai/gpt-5.5 (20 runs)

chatgpt 55%
refusal 45%

openai/gpt-5.4-mini (20 runs)

chatgptsuggestion: gpt-4.1 45%
openai chatgptsuggestion: gpt-4.1 15%
chatgpt 10%
gpt-5 10%
gpt-4.1 10%

openai/gpt-5.4 (20 runs)

openai 45%
refusal 25%
chatgpt 15%
generic 10%

openai/gpt-5.3-chat (20 runs)

gpt-5.3 100%

openai/gpt-4o-mini (20 runs)

gpt-3.5 35%
chatgpt 30%
gpt-4 20%
chatgpt suggestion: gpt-4 10%

openai/gpt-oss-120b (20 runs)

gpt-4 35%
chatgpt 20%
gpt-4 turbo 20%
chatgpt suggestion: gpt-4 10%
chatgpt, based on the gpt-4 architecture 10%

openai/gpt-4.1-mini (20 runs)

gpt-4 turbo 70%
gpt-4 30%

Qwen

qwen/qwen3.7-plus (20 runs)

qwen 60%
qwen tongyi qianwen 30%

qwen/qwen3.6-flash (20 runs)

qwen 65%
qwen tongyi qianwen 30%

qwen/qwen3.7-max (20 runs)

qwen tongyi qianwen 50%
qwen 35%
gemini 15%

qwen/qwen3.6-max-preview (20 runs)

qwen 55%
qwen tongyi qianwen 45%

qwen/qwen3.6-27b (20 runs)

qwen 95%

qwen/qwen3-235b-a22b-2507 (20 runs)

qwen3 75%
refusal 20%

qwen/qwen3.5-flash-02-23 (20 runs)

qwen3.5 100%

qwen/qwen3.6-plus (20 runs)

qwen 60%
qwen tongyi qianwen 40%

qwen/qwen3.5-122b-a10b (18 runs)

qwen3.5 77.7%
gemini 16.7%

Sakana

sakana/fugu-ultra (20 runs)

fugu-ultra 90%
other 10%

StepFun

stepfun/step-3.7-flash (20 runs)

step 25%
step 2.0 20%
step 1.5 15%
step 2.5 10%

Tencent

tencent/hy3 (20 runs)

claude 3.5 sonnet 30%
generic 20%
gpt-4 15%
other 15%
claude 10%

ThinkingMachines

thinkingmachines/inkling (20 runs)

inkling 80%
other 20%

xAI

x-ai/grok-4.5 (20 runs)

grok 4 95%

x-ai/grok-4.3 (20 runs)

grok 75%
generic 10%

x-ai/grok-4.20 (20 runs)

grok 4 60%
claude 3.5 sonnet 30%
gpt-4o 10%

Xiaomi

xiaomi/mimo-v2.5-pro (20 runs)

mimo 55%
mimo version 1 20%

xiaomi/mimo-v2.5 (20 runs)

mimo 45%
claude 15%
claude 3.5 sonnet 10%

Z.ai

z-ai/glm-5.2 (20 runs)

glm 55%
claude 3.5 sonnet 15%
claude 10%
refusal 10%

z-ai/glm-5.1 (20 runs)

glm-4 40%
glm 40%
claude 3.5 sonnet 15%

z-ai/glm-5-turbo (20 runs)

gemini 1.5 pro 45%
claude 3.5 sonnet 30%
glm-4 15%

z-ai/glm-5 (20 runs)

claude 60%
claude 3.5 sonnet 20%
claude 3 opus 10%

z-ai/glm-4.7-flash (20 runs)

glm 45%
glm-4 35%
generic 15%

z-ai/glm-4.7 (20 runs)

glm-4 40%
glm 35%
gpt-4o 10%
claude 3.5 sonnet 10%