メインコンテンツへスキップ
buildradar
ログイン

petergpt/bullshit-benchmark

@petergpt

BullshitBenchは、AIモデルが自信を持って回答する代わりに、ナンセンスなプロンプトに異議を唱えるかどうかを測定します(Peter Gostev作成)。

スター
1,844
フォーク
73
言語
Python
ライセンス
MIT
最終プッシュ
1 週間前
Python

関連 Intel はまだありません

このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。