BullshitBench 用于衡量 AI 模型是否会质疑无意义的提示词,而不是自信地回答它们,由 Peter Gostev 创建。
radar 追踪的来源里还没有出现过这个 repo。收集器按计划运行——等它覆盖到这个 repo 再回来看看。