值得花20分钟的四个测试
问一个你已经知道答案的问题、一个来自你工作中真正困难的问题、一个靠近你话题边界的问题,然后让一段对话持续进行15条消息。这四个测试,涵盖了准确性、能力、过滤器和记忆,也就是会影响到你的一切。
随意的使用,能告诉你一个产品用起来感觉如何,却隐藏了它会如何失败。而失败,才是决定你会不会继续使用某样东西的关键,所以值得刻意地、尽早地把它引出来。
本页内容
已知答案的问题
一个来自你专业领域、你能精确判断回答对错的问题。这是唯一一个衡量准确性、而不是流畅度的测试,也是人们最常跳过的一个,因为答案本身对他们没用。重点不在于那个答案本身,而在于校准你该在多大程度上信赖它给出的其余内容。
真正困难的问题
一个你自己曾经真正为之头疼的问题。简单的问题,任何东西都能答得好,所以它们区分不出任何差异。难度,才是区分不同产品的地方,而只有你自己的工作,才能提供恰到好处的难度。
边界案例
一个来自你工作中、靠近敏感话题的真实例子。不是挑衅,而是一个可能会被谨慎的过滤器拦下的正当问题。这能告诉你这个产品对你的领域来说是否可用,而这是任何评测都告诉不了你的。
长对话
围绕一个话题聊十五条消息,然后回头提起第二条消息里的内容。这衡量的是记忆窗口和走样程度,也是各产品差异最大、而评测最少去看的地方。人们对一个助手大多数的失望,其实是在第30条消息时才产生的失望。
转投之前,人们通常会问
我应该在任何地方都用同样的测试吗?
应该,而且要把它们写下来。可比性,正是全部的价值所在,而凭记忆提出的问题,会在不同产品之间走样。
20分钟真的够吗?
对于排除不合适的产品来说,绰绰有余。对于在两个好产品之间做选择,一周的真实使用会给出更好的判断。
如果它没通过某一项测试怎么办?
这取决于是哪一项。没通过边界测试,意味着这个产品对你的领域来说不可用;没通过长对话测试,只是让人烦,但还能将就用。
在这里做一遍这四个测试,和你目前正在用的东西比较一下。
打开聊天