メインコンテンツへスキップ
buildradar
Sign in
トピック · benchmark

benchmark

benchmark がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

158 件のリポジトリ
  • PointTinyBenchmark@ucas-vg

    UCAS-VGのポイントベースおよび極小オブジェクト検出・ローカライゼーションコードセット

    694+0直近 7 日のスター増減
  • long-form-factuality@google-deepmind

    大規模言語モデルにおける長文の事実性のベンチマーク。論文「Long-form factuality in large language models」のオリジナルコード。

    693+2直近 7 日のスター増減
  • Julia言語向けのベンチマークフレームワーク

    683+1直近 7 日のスター増減
  • VLM2Vec@TIGER-AI-Lab

    このリポジトリには、「VLM2Vec / MMEB」[ICLR 2025]、「VLM2Vec-V2 / MMEB-V2」[TMLR 2026]、および「MMEB-V3」[COLM 2026] のコードが含まれています

    682+2直近 7 日のスター増減
  • openmixup@Westlake-AI

    CAIRI 教師あり、半教師あり、および自己教師あり視覚表現学習ツールボックスおよびベンチマーク

    658+0直近 7 日のスター増減
  • ClawBench@TIGER-AI-Lab

    日常タスクにおけるブラウザ AI エージェントのオープンソースベンチマーク。

    657+40直近 7 日のスター増減
  • Awesome-LLM-Eval: LLMの評価に特化したツール、データセット/ベンチマーク、デモ、リーダーボード、論文、ドキュメント、モデルの厳選リスト。

    656-2直近 7 日のスター増減
  • BenchMARL@facebookresearch

    BenchMARLは、マルチエージェント強化学習(MARL)のベンチマークを行うためのライブラリです。BenchMARLを使用することで、「再現性」と「標準化」という2つの核心的原則に基づき、さまざまなMARLアルゴリズム、タスク、モデルを迅速に比較できます。

    656+0直近 7 日のスター増減
  • AICGSecEval@Tencent

    A.S.E (AICGSecEval) は、Tencent Wukong Code Security Team によって開発されたリポジトリレベルの AI 生成コードセキュリティ評価ベンチマーク。

    655+2直近 7 日のスター増減
  • datasets@benedekrozemberczki

    ネットワーク科学および機械学習の研究のために収集した、なかなか興味深いデータセットのレポジトリ

    655+0直近 7 日のスター増減
  • indonlu@IndoNLP

    インドネシア語初の大規模自然言語処理ベンチマーク。複数の下流タスク、事前学習済み IndoBERT モデル、およびスターターコードを提供 (AACL-IJCNLP 2020)

    655+1直近 7 日のスター増減
  • Kotlinマルチプラットフォーム向けベンチマークツールキット

    644+0直近 7 日のスター増減
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: 大規模言語モデルにおける信頼性

    632+2直近 7 日のスター増減
  • AgentLab@ServiceNow

    AgentLab: 多様なタスクでWebエージェントの開発、テスト、ベンチマークを行うためのオープンソースフレームワーク。スケーラビリティと再現性を重視して設計されています。

    628+0直近 7 日のスター増減
  • rspec-benchmark@piotrmurach

    RSpec 向けのパフォーマンス検証マッチャー

    618+0直近 7 日のスター増減
  • NIID-Bench@Xtra-Computing

    連合学習ベンチマーク - 非IIDデータサイロにおける連合学習:実験的研究 (ICDE 2022)

    618+0直近 7 日のスター増減
  • TextClassificationBenchmark@FreedomIntelligence

    PyTorchにおけるテキスト分類のベンチマーク

    608+0直近 7 日のスター増減
  • KLUE@KLUE-benchmark

    韓国語NLUベンチマーク

    604+0直近 7 日のスター増減
  • globalping@jsdelivr

    ping、traceroute、DNS解決などのネットワークテストを実行するグローバルなプローブネットワーク

    597+3直近 7 日のスター増減
  • ビジュアルオブジェクトトラッキング

    596+2直近 7 日のスター増減
  • rewrk@lnx-search

    HTTP/1およびHTTP/2のベンチマークをサポートする、よりモダンなHTTPフレームワークベンチマーカー。

    588+1直近 7 日のスター増減
  • CL-bench@Tencent-Hunyuan

    CL-bench: コンテキスト学習のためのベンチマーク

    580+2直近 7 日のスター増減
  • ParseBench@run-llama

    ParseBench - AI エージェントのためのドキュメント解析ベンチマーク

    563+6直近 7 日のスター増減
  • alpaca@p-ranav

    C++17 で書かれたシリアライゼーションライブラリ - マクロやボイラープレートコードなしで C++ の構造体をコンパクトなバイト配列にパックします

    560+0直近 7 日のスター増減
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    559直近 7 日のスター増減
  • いくつかのプログラミング言語の素朴なパフォーマンス比較(JavaScript、Kotlin、Rust、Swift、Nim、Python、Go、Haskell、D、C++、Java、C#、Object Pascal、Ada、Lua、Ruby)

    557+0直近 7 日のスター増減
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard: 自動音声認識のための大規模で堅牢かつ包括的なベンチマークプラットフォーム。

    553+3直近 7 日のスター増減
  • Meta Agents Research Environments は、動的かつ現実的なシナリオで AI エージェントを評価するために設計された包括的なプラットフォームです。静的なベンチマークとは異なり、このプラットフォームは、新しい情報が利用可能になるにつれてエージェントが戦略を適応させなければならない進化する環境を導入し、現実世界の課題を反映しています。

    550+3直近 7 日のスター増減
  • 社内文書におけるRAGのためのデータセットとベンチマーク。

    542+9直近 7 日のスター増減
  • NBench@petabridge

    .NET アプリケーション向けのパフォーマンステストおよびベンチマークフレームワーク :chart_with_upwards_trend:

    540+0直近 7 日のスター増減
← トピック一覧に戻る