大模型能力测试提示词
这些提示词不是考试,也不构成跑分 —— 它们的作用是快速摸出模型的手感:哪类活它稳,哪类活它一到就翻车。做法很简单:复制一条,粘给你想试的模型,看它怎么答;同一组题横着比几个模型才有意义。
几句先说在前面:
- 别问「你是什么模型」 —— 它们经常答错,而且答案多半来自系统提示而不是它的自知。
- 单次翻车不等于不行:结果随版本、温度、上下文长度波动。要下结论就多试几次、换个说法再试。
- 追问比首答有信息量:答对之后追一句「为什么」,能分清是真懂还是蒙对。
绘图与空间
用 SVG 画一只骑自行车的鹈鹕
用 SVG 画一只骑自行车的鹈鹕。社区里流传最广的一道 SVG 生成题:它同时考空间关系(鸟在车上、脚踩在踏板上、两个轮子成对)和代码能力(画出来的 SVG 得真能渲染)。
常见翻车:鹈鹕飘在自行车旁边、自行车少一个轮子、鸟腿从身体里穿出来、坐标算错导致图形跑到画布外。看的时候别抠笔画细节,先看整体构图像不像。
画一个时钟,显示 3:15
画一个时钟表盘,指针指向 3:15。考的是表盘几何与指针角度:分针指向 3,时针要指向 3 再往前走四分之一格。很多模型会画成 3:00,或者两根针叠在一起,或者把 3:15 理解成两点一刻。
用 ASCII 字符画一只猫
用 ASCII 字符画一只猫。纯文本模态下的图形想象与字符控制。看两点:一眼能不能认出是猫;宽高比有没有崩(字符不是正方形,很多模型会忽略这一点)。
推理与计数
9.11 和 9.9 哪个大?
9.11 和 9.9 哪个大?经典陷阱:按字符串比大小会得出 9.11 更大。答对之后追问「为什么」,能看出是真懂小数位比较,还是靠概率蒙对。
strawberry 里有几个字母 r
strawberry 这个单词里有几个字母 r?考逐字符扫描,比数单词个数难得多。翻车方式很一致:先答一个数,被质疑后改口,然后越改越错。可以换成 pineapple 里几个 p、mississippi 里几个 s。
把 strawberry 倒过来拼写
把 strawberry 倒过来拼写。和上一题同源但要真正逆序,不能只「看起来像倒过来」。常见的错是把 r 或 e 的位置对调。
指令遵循
回答时不许出现「的」字
请解释为什么天空是蓝色的,但整段回答里不能出现「的」这个字。考约束遵循与自我检查。翻车:前半段守住了、后面漏出来;或者为了规避干脆糊弄过去。可以换别的字(比如「了」「一」),也可以限定字数的上限。
用不超过 20 个字解释什么是熵
用不超过 20 个字解释什么是熵。长度约束 + 概括能力。看它有没有真去数(自己数一遍),以及为了凑短是不是把意思丢了。
原样复述
把下面这句话原样复述一遍,一个字都不要改、也不要加标点:
我明天要早起,但是(大概率)起不来很多模型会「顺手改通顺」:补标点、改语序、把括号里的词挪位置。原样复述看起来简单,其实是不折不扣的指令遵循题。
长文本与检索
找出自相矛盾的地方
下面是一篇文章,请找出其中前后自相矛盾的地方,并指出两处分别在讲什么:
<把你的长文贴在这里>考长上下文里的信息保持与比对。自己贴长文是关键 —— 越贴近你真实会用的场景(技术文档、合同、论文)越能看出它是不是只读了开头。
找出唯一出现一次的数字
下面这段文字里有很多数字,只有一个数字只出现过一次。请把它找出来:
<贴一段你自己编的、含有多个数字的长文>比上一题更机械,但因此更可验证 —— 你可以自己数一遍对答案。适合快速判断模型有没有真的读完。
中文表达
对仗翻译
把「落霞与孤鹜齐飞,秋水共长天一色」翻成英文,尽量保留对仗。考中英转换 + 形式约束。翻车:只翻意思、丢掉对仗;或者为了押韵硬凑,读到一半不知道在说什么。
七言一句
写一句七个字的句子,描述今天的天气。字数约束 + 内容相关,两样都不能丢。看它有没有为了凑七个字把话说残。
四个字概括
用四个字概括下面这段话:
<贴一段你自己写的文字>中文的一个常用场景:摘要要短、要像标题。看它给的是通用套话(「众说纷纭」)还是真扣住了内容。
最后
这些题能告诉你的,是它在哪些类型上会稳定翻车,而不是「它聪明不聪明」。真要选一个模型干活,拿你自己的真实任务试一遍,比任何题单都准。