benchmark
benchmark がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #121
UCAS-VGのポイントベースおよび極小オブジェクト検出・ローカライゼーションコードセット
★ 694+0直近 7 日のスター増減 - #122
大規模言語モデルにおける長文の事実性のベンチマーク。論文「Long-form factuality in large language models」のオリジナルコード。
★ 693+2直近 7 日のスター増減 - #123
Julia言語向けのベンチマークフレームワーク
★ 683+1直近 7 日のスター増減 - #124
このリポジトリには、「VLM2Vec / MMEB」[ICLR 2025]、「VLM2Vec-V2 / MMEB-V2」[TMLR 2026]、および「MMEB-V3」[COLM 2026] のコードが含まれています
★ 682+2直近 7 日のスター増減 - #125★ 658+0直近 7 日のスター増減
- #126★ 657+40直近 7 日のスター増減
- #127
Awesome-LLM-Eval: LLMの評価に特化したツール、データセット/ベンチマーク、デモ、リーダーボード、論文、ドキュメント、モデルの厳選リスト。
★ 656-2直近 7 日のスター増減 - #128
BenchMARLは、マルチエージェント強化学習(MARL)のベンチマークを行うためのライブラリです。BenchMARLを使用することで、「再現性」と「標準化」という2つの核心的原則に基づき、さまざまなMARLアルゴリズム、タスク、モデルを迅速に比較できます。
★ 656+0直近 7 日のスター増減 - #129
A.S.E (AICGSecEval) は、Tencent Wukong Code Security Team によって開発されたリポジトリレベルの AI 生成コードセキュリティ評価ベンチマーク。
★ 655+2直近 7 日のスター増減 - #130★ 655+0直近 7 日のスター増減
- #131
インドネシア語初の大規模自然言語処理ベンチマーク。複数の下流タスク、事前学習済み IndoBERT モデル、およびスターターコードを提供 (AACL-IJCNLP 2020)
★ 655+1直近 7 日のスター増減 - #132
Kotlinマルチプラットフォーム向けベンチマークツールキット
★ 644+0直近 7 日のスター増減 - #133★ 632+2直近 7 日のスター増減
- #134
AgentLab: 多様なタスクでWebエージェントの開発、テスト、ベンチマークを行うためのオープンソースフレームワーク。スケーラビリティと再現性を重視して設計されています。
★ 628+0直近 7 日のスター増減 - #135
RSpec 向けのパフォーマンス検証マッチャー
★ 618+0直近 7 日のスター増減 - #136
連合学習ベンチマーク - 非IIDデータサイロにおける連合学習:実験的研究 (ICDE 2022)
★ 618+0直近 7 日のスター増減 - #137
PyTorchにおけるテキスト分類のベンチマーク
★ 608+0直近 7 日のスター増減 - #138★ 604+0直近 7 日のスター増減
- #139
ping、traceroute、DNS解決などのネットワークテストを実行するグローバルなプローブネットワーク
★ 597+3直近 7 日のスター増減 - #140
ビジュアルオブジェクトトラッキング
★ 596+2直近 7 日のスター増減 - #141★ 588+1直近 7 日のスター増減
- #142★ 580+2直近 7 日のスター増減
- #143
ParseBench - AI エージェントのためのドキュメント解析ベンチマーク
★ 563+6直近 7 日のスター増減 - #144★ 560+0直近 7 日のスター増減
- #145
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 559—直近 7 日のスター増減 - #146
いくつかのプログラミング言語の素朴なパフォーマンス比較(JavaScript、Kotlin、Rust、Swift、Nim、Python、Go、Haskell、D、C++、Java、C#、Object Pascal、Ada、Lua、Ruby)
★ 557+0直近 7 日のスター増減 - #147
SpeechIO Leaderboard: 自動音声認識のための大規模で堅牢かつ包括的なベンチマークプラットフォーム。
★ 553+3直近 7 日のスター増減 - #148
Meta Agents Research Environments は、動的かつ現実的なシナリオで AI エージェントを評価するために設計された包括的なプラットフォームです。静的なベンチマークとは異なり、このプラットフォームは、新しい情報が利用可能になるにつれてエージェントが戦略を適応させなければならない進化する環境を導入し、現実世界の課題を反映しています。
★ 550+3直近 7 日のスター増減 - #149
社内文書におけるRAGのためのデータセットとベンチマーク。
★ 542+9直近 7 日のスター増減 - #150★ 540+0直近 7 日のスター増減