メインコンテンツへスキップ
buildradar
Sign in
トピック · evaluation

evaluation

evaluation がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

80 件のリポジトリ
  • evaluation-guidebook@huggingface

    Open LLM Leaderboard の管理や lighteval の設計を通じて得た、LLM 評価に関する実践的な知見と理論的知識の共有

    2,143+2直近 7 日のスター増減
  • avalanche@ContinualAI

    Avalanche: PyTorch ベースの継続学習向けエンドツーエンドライブラリ

    2,088+0直近 7 日のスター増減
  • EvalAI@Cloud-CV

    :cloud: :rocket: :bar_chart: :chart_with_upwards_trend: AI の最先端技術の評価

    2,037-2直近 7 日のスター増減
  • alpaca_eval@tatsu-lab

    指示追従型言語モデルのための自動評価ツール。人間による検証済み、高品質、低コスト、高速。

    2,012-1直近 7 日のスター増減
  • AB3DMOT@xinshuoweng

    (IROS 2020, ECCVW 2020) 「3D Multi-Object Tracking: A Baseline and New Evaluation Metrics」の公式 Python 実装

    1,846+0直近 7 日のスター増減
  • WFGY@onestardao

    WFGYは、AI推論、RAG、エージェント、実世界のワークフローに向けた大型オープンソースリリースであるWFGY 5.0 Polaris Protocolへと向かっています。Problem Map、Global Debug Card、WFGY 4.0、CFVイースターエッグが含まれています。

    1,786+1直近 7 日のスター増減
  • EmoLLM@SmartFlowAI

    メンタルヘルス向け大規模言語モデル (LLM x Mental Health)。事前学習・事後学習、データセット、評価、デプロイ、RAGに対応し、InternLM、Qwen、Baichuan、DeepSeek、Mixtral、Llama、GLMシリーズのモデルをサポート

    1,781+1直近 7 日のスター増減
  • trpc-agent-go@trpc-group

    グラフワークフロー、ツール、メモリ、A2A、AG-UI、MCP、評価、可観測性を備えた、本番環境向けエージェントシステム構築用 Go フレームワーク。

    1,760+12直近 7 日のスター増減
  • ragbits@deepsense-ai

    GenAI アプリケーションを迅速に開発するためのビルディングブロック

    1,668+0直近 7 日のスター増減
  • サーベイ論文「A Survey on Evaluation of Large Language Models」の公式GitHubページ

    1,608-1直近 7 日のスター増減
  • pycm@sepandhaghighi

    Python の多クラス混同行列ライブラリ

    1,506+0直近 7 日のスター増減
  • nlg-eval@Maluuba

    自然言語生成向け各種教師なし自動評価指標の評価コード

    1,391+0直近 7 日のスター増減
  • lispy@abo-abo

    シンプルで快適な LISP 編集

    1,300+0直近 7 日のスター増減
  • xai@EthicalML

    XAI - 機械学習用の説明可能性ツールボックス

    1,260+0直近 7 日のスター増減
  • intellagent@plurai-ai

    シミュレーションされた現実的な合成インタラクションを使用して、エージェントの包括的な診断と最適化を行うためのフレームワーク。

    1,257+0直近 7 日のスター増減
  • KernelBench@ScalingIntelligence

    KernelBench: LLMはGPUカーネルを書けるか? - ベンチマーク + Torch -> CUDA(その他DSL含む)対応ツールキット

    1,227+7直近 7 日のスター増減
  • kubetorch@run-house

    機械学習インフラ向け PyTorch のように、Kubernetes 上で AI ワークロードを魔法のように分散および実行します。

    1,224+0直近 7 日のスター増減
  • fuzzbench@google

    FuzzBench - サービスとしてのファザーベンチマーク

    1,206+0直近 7 日のスター増減
  • torch-fidelity@toshas

    PyTorchにおける生成モデル向けの忠実度の高いパフォーマンス指標

    1,200+1直近 7 日のスター増減
  • Tracely-ai@Jwuthri

    AIエージェント向けのトレースネイティブなCI/CD — 本番環境のエラーをPRをブロックする回帰テストに変換します。自動検出、クラスタリング、独立したケースへの固定、CIでのゼロコスト再実行を行います。

    1,176-22直近 7 日のスター増減
  • ncalc@ncalc

    .NET 向けの高パフォーマンスで軽量な数式評価ライブラリ。柔軟性と高性能を重視して設計されており、幅広い数理・論理演算をサポートします。

    1,156+2直近 7 日のスター増減
  • Gym@NVIDIA-NeMo

    環境を使用してモデルやエージェントを評価および改善する

    1,155+7直近 7 日のスター増減
  • prometheus-eval@prometheus-eval

    Prometheus と GPT4 を使用して LLM の応答を評価する 💯

    1,111+4直近 7 日のスター増減
  • langsmith-sdk@langchain-ai

    LangSmith クライアント SDK の実装

    1,049+9直近 7 日のスター増減
  • データセットの視覚化、データ処理、結果の評価を行うための SemanticKITTI API

    898+3直近 7 日のスター増減
  • deepfabric@nolabs-ai

    単一のパイプラインで高品質な合成データの生成、トレーニング、測定、評価を行う

    885+3直近 7 日のスター増減
  • ClawProBench@suyoumo

    ClawProBench は、決定論的な採点と複数回試行の信頼性を備え、OpenClaw ランタイムで LLM エージェントを評価するためのライブファーストのベンチマークハーネスです。

    823+0直近 7 日のスター増減
  • OpenJudge@agentscope-ai

    OpenJudge: 総合評価と品質報酬のための統一フレームワーク

    819+14直近 7 日のスター増減
  • gval@PaesslerAG

    golang における式評価

    814+1直近 7 日のスター増減
  • web-codegen-scorer@angular

    Web Codegen Scorer は、LLM が生成したウェブコードの品質を評価するためのツールです。

    775+4直近 7 日のスター増減
← トピック一覧に戻る