Qwen: Qwen3 VL 235B A22B Thinking

by qwen

2,133 claims submitted by 157 reviewers

Monitored by HumanJudge · Endpoint registered, 76 traces logged
Maintained by HumanJudge Admin
Enrolled in: Spanish Culture Challenge: GPT-5.2 , Japanese Culture Challenge: GPT-5.2 , Mexican Culture Challenge: GPT-5.2 , AP Biology Challenge: GPT-5.2 , Spanish Cinema Challenge: GPT-5.2 , Korean Culture Challenge: GPT-5.2 , Taiwanese Culture Challenge: GPT-5.2 , Brazilian Culture Challenge: GPT-5.2 , Argentine Culture Challenge: GPT-5.2 , Japanese Language Challenge: GPT-5.2 , Arabic Music Challenge: GPT-5.2 , Gulf Culture Challenge: GPT-5.2 , Latin Music Challenge: GPT-5.2 , Arabic Language Challenge: GPT-5.2 , Chinese Cinema Challenge: GPT-5.2 , Mexican Cinema Challenge: GPT-5.2 , Korean Language Challenge: GPT-5.2 , AP Government Challenge: GPT-5.2 , Chinese Language Challenge: GPT-5.2 , Korean Cinema Challenge: GPT-5.2 , Chinese Culture Challenge: GPT-5.2 , J-drama Challenge: GPT-5.2 , AP English Language Challenge: GPT-5.2 , C-drama Challenge: GPT-5.2 , 日本文化のヒーロー | Japanese Culture Hero , Levantine Culture Challenge: GPT-5.2 , Egyptian Culture Challenge: GPT-5.2 , Arab Cinema Challenge: GPT-5.2 , AP English Literature Challenge: GPT-5.2 , AP US History Challenge: GPT-5.2 , K-pop Challenge: GPT-5.2 , AP Calculus AB Challenge: GPT-5.2 , Spanish Language Challenge: GPT-5.2 , K-drama Challenge: GPT-5.2 , Spanish Music Challenge: GPT-5.2 , Humans Evaluation Benchmark for AI Marketing and Content Generation , C-pop Challenge: GPT-5.2
Performance
Humans Evaluation Benchmark for AI Marketing and Content Generation 89%
1789 votes 202 flags 148 reviewers
AP Calculus AB Challenge: GPT-5.2 100%
102 votes 0 flags 15 reviewers
日本文化のヒーロー | Japanese Culture Hero 94%
98 votes 6 flags 19 reviewers
AP Biology Challenge: GPT-5.2 96%
44 votes 2 flags 44 reviewers
AP English Language Challenge: GPT-5.2 100%
33 votes 0 flags 13 reviewers
AP English Literature Challenge: GPT-5.2 95%
21 votes 1 flags 7 reviewers
AP US History Challenge: GPT-5.2 100%
21 votes 0 flags 7 reviewers
K-pop Challenge: GPT-5.2 100%
18 votes 0 flags 2 reviewers
AP Government Challenge: GPT-5.2 100%
7 votes 0 flags 7 reviewers
Independent Claims
flag AI Marketing & Content Generation 7/22/2026

The whole response is not concise at all. There is no need to explain every tagline because the audience would understan...

— Zehong Hu

flag AP Biology Challenge: GPT-5.2 7/20/2026

Not look human

— Abdullahi Muhammad

pass AI Marketing & Content Generation 7/20/2026

"The AI response fails to provide a clean output ready for posting. Instead of outputting just the requested X thread, i...

— Thuy Hang Vo

pass AI Marketing & Content Generation 7/20/2026

The AI generated a strong, highly engaging LinkedIn post tailored specifically to college students. It uses short, punch...

— Thuy Hang Vo

flag AI Marketing & Content Generation 7/20/2026

It's giving the showing off vibe. The prompt just asks about the script. The response doesn't have to give pro tip like ...

— Zehong Hu

This evaluation was conducted independently. Qwen: Qwen3 VL 235B A22B Thinking did not participate in or pay for this evaluation. All verdicts come from double-blind evaluation — reviewers did not know which AI produced each response.

We help people define what trustworthy AI looks like — publicly, transparently, together. Support this mission