evaluation
evaluation がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #61★ 768-1直近 7 日のスター増減
- #62
[EMNLP 2024 & AAAI 2026] LLM、VLM、動画生成モデルなどの大規模モデルを圧縮するための強力なツールキット
★ 747+1直近 7 日のスター増減 - #63
🦞 エージェントのトレースをOpikにエクスポートするOpenClaw公式プラグイン。エージェントの動作、コスト、トークン、エラーなどを確認・監視できます。
★ 725+0直近 7 日のスター増減 - #64
IOU Tracker の Python 実装
★ 702+0直近 7 日のスター増減 - #65★ 697+4直近 7 日のスター増減
- #66
大規模言語モデルにおける長文の事実性のベンチマーク。論文「Long-form factuality in large language models」のオリジナルコード。
★ 693+2直近 7 日のスター増減 - #67★ 657+40直近 7 日のスター増減
- #68
Awesome-LLM-Eval: LLMの評価に特化したツール、データセット/ベンチマーク、デモ、リーダーボード、論文、ドキュメント、モデルの厳選リスト。
★ 656-2直近 7 日のスター増減 - #69
AutoPrompt: マスク言語モデルのための自動プロンプト構築
★ 641+1直近 7 日のスター増減 - #70★ 632+2直近 7 日のスター増減
- #71
1つのC#ファイルで実装された、シンプルな数式および疑似C#式の評価器。小さなC#風スクリプトの実行も可能
★ 630+0直近 7 日のスター増減 - #72
大規模言語モデルにおける機械アンラーニング(Machine Unlearning)のリポジトリ
★ 623+0直近 7 日のスター増減 - #73
TCExamは、大学、学校、企業向けのCBA(コンピュータベースドテスト)システム(e試験、CBT)であり、教育者やトレーナーがアンケート、クイズ、小テスト、試験を作成、スケジュール、実施、レポート作成できるようにします。
★ 619+0直近 7 日のスター増減 - #74
Python向けのシンプルで安全、サンドボックス化された拡張可能な式評価エンジン
★ 611+0直近 7 日のスター増減 - #75
一対の画像から画像マッチングを実行するさまざまな手法を評価するためのツールボックスリポジトリ
★ 594-1直近 7 日のスター増減 - #76
論文「MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI」の評価コードを含むリポジトリ
★ 593+1直近 7 日のスター増減 - #77
質問と SQL クエリをペアにしたデータセットのコレクション
★ 588+1直近 7 日のスター増減 - #78
ParseBench - AI エージェントのためのドキュメント解析ベンチマーク
★ 563+6直近 7 日のスター増減 - #79
Meta Agents Research Environments は、動的かつ現実的なシナリオで AI エージェントを評価するために設計された包括的なプラットフォームです。静的なベンチマークとは異なり、このプラットフォームは、新しい情報が利用可能になるにつれてエージェントが戦略を適応させなければならない進化する環境を導入し、現実世界の課題を反映しています。
★ 550+3直近 7 日のスター増減 - #80
社内文書におけるRAGのためのデータセットとベンチマーク。
★ 542+9直近 7 日のスター増減