メインコンテンツへスキップ
buildradar
Sign in
トピック · evaluation

evaluation

evaluation がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
80
総スター数
291,588
平均スター数
3,645
シェア
0.02%

evaluation と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、evaluation がタグ付けされたリポジトリ。

  • fable-method@Sahir619

    Fable Workflow:Claude Fable 5の仕組みを、あらゆるモデルが実行できるスキルへと昇華させ、その正確性を保つ評価機能を備えたもの。思考・実行・検証のプロセス。

    2,267
  • Tracely-ai@Jwuthri

    AIエージェント向けのトレースネイティブなCI/CD — 本番環境のエラーをPRをブロックする回帰テストに変換します。自動検出、クラスタリング、独立したケースへの固定、CIでのゼロコスト再実行を行います。

    1,159
  • HarnessEval-W@MirroS-Lab

    HarnessEval-W: Agentifying the Evaluation of Visual Worlds

    256
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    🪢 オープンソースのAIエンジニアリングプラットフォーム:LLM評価、オブザーバビリティ、メトリクス、プロンプト管理、プレイグラウンド、データセット。OpenTelemetry、LangChain、OpenAI SDK、LiteLLMなどと統合。🍊YC W23

    33,909+372直近 7 日のスター増減
  • mlflow@mlflow

    エージェント、LLM、MLモデルのためのオープンソースAIエンジニアリングプラットフォーム。MLflowは、あらゆる規模のチームがコストを管理し、モデルとデータへのアクセスを管理しながら、本番品質のAIアプリケーションをデバッグ、評価、監視、最適化できるようにします。

    27,728+114直近 7 日のスター増減
  • promptfoo@promptfoo

    プロンプト、エージェント、RAGをテスト。AI向けのレッドチーミング/ペネトレーションテスト/脆弱性スキャン。GPT、Claude、Gemini、DeepSeekなどのパフォーマンスを比較。コマンドラインおよびCI/CD統合を備えたシンプルな宣言的設定。OpenAIおよびAnthropicによって使用されています。

    24,664+215直近 7 日のスター増減
  • opik@comet-ml

    包括的なトレーシング、自動評価、本番環境対応のダッシュボードにより、LLMアプリケーション、RAGシステム、エージェンティックワークフローをデバッグ、評価、監視できます。

    21,668+143直近 7 日のスター増減
  • WeKnora@Tencent

    オープンソースのLLMナレッジプラットフォーム:生のドキュメントを検索可能なRAG、自律的な推論エージェント、自己維持型のWikiに変換します。

    20,899+581直近 7 日のスター増減
  • ragas@vibrantlabsai

    LLMアプリケーション評価を強力に推進 🚀

    15,541+123直近 7 日のスター増減
  • oumi@oumi-ai

    Qwen、Gemma、または任意のオープンウェイトLLMを簡単にファインチューニング、評価、デプロイ可能!

    9,380+3直近 7 日のスター増減
  • opencompass@open-compass

    OpenCompassはLLM評価プラットフォームであり、100以上のデータセットで幅広いモデル(Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claudeなど)をサポートしています。

    7,374+48直近 7 日のスター増減
  • helicone@Helicone

    🧊 オープンソースのLLMオブザーバビリティプラットフォーム。1行のコードで監視、評価、実験が可能。YC W23 🍓

    6,116+23直近 7 日のスター増減
  • coze-loop@coze-dev

    次世代AIエージェント最適化プラットフォーム:Cozeloopは、開発、デバッグ、評価から監視に至るまでのライフサイクル全体管理機能を提供することで、AIエージェント開発の課題に対処します。

    5,706+7直近 7 日のスター増減
  • AutoRAG@Marker-Inc-Korea

    AutoRAG:これでエージェントはコンピューター内のあらゆるものを検索できます。頻繁に使用するほど、より賢くなります。

    5,057+7直近 7 日のスター増減
  • Kiln@Kiln-AI

    AIシステムの構築、評価、最適化。evals、RAG、エージェント、ファインチューニング、合成データ生成、データセット管理、MCPなどを含む。

    5,037+7直近 7 日のスター増減
  • lmms-eval@EvolvingLMMs-Lab

    テキスト、画像、ビデオ、オーディオタスクを網羅するオールインワンのマルチモーダル評価ツールキット

    4,383+11直近 7 日のスター増減
  • VLMEvalKit@open-compass

    大規模マルチモーダルモデル (LMMs) のオープンソース評価ツールキット。220以上のLMM、80以上のベンチマークをサポート。

    4,362+10直近 7 日のスター増減
  • evo@MichaelGrupp

    オドメトリとSLAMの評価のためのPythonパッケージ。

    4,310+7直近 7 日のスター増減
  • langwatch@langwatch

    LLM 評価および AI エージェントテスト用プラットフォーム

    3,517+13直近 7 日のスター増減
  • mteb@embeddings-benchmark

    MTEB:言語およびモダリティを横断した埋め込みの最先端評価

    3,409+9直近 7 日のスター増減
  • evalscope@modelscope

    効率的な大規模モデル(LLM、VLM、AIGC)の評価とパフォーマンスベンチマークのための、効率的でカスタマイズ可能なフレームワーク。

    3,331+47直近 7 日のスター増減
  • SuperCLUE@CLUEbenchmark

    SuperCLUE: 中国語汎用大規模モデルの総合ベンチマーク

    3,299-1直近 7 日のスター増減
  • lmnr@lmnr-ai

    Laminar - AIエージェント向けに特化して構築されたオープンソースのオブザーバビリティプラットフォーム。YC S24。

    3,210+24直近 7 日のスター増減
  • klipse@viebel

    Klipse は、技術ブログにインタラクティブなコードスニペットを埋め込むための JavaScript プラグインです。

    3,134+0直近 7 日のスター増減
  • ChainForge@ianarawjo

    LLMプロンプトの耐久テストを行うためのオープンソースのビジュアルプログラミング環境。

    3,028+1直近 7 日のスター増減
  • yao-meta-skill@yaojingang

    YAO = Yielding AI Outcomes。再利用可能なエージェントスキルのための、厳密なエンジニアリング、評価、ガバナンス、およびポータビリティシステム。

    2,557+160直近 7 日のスター増減
  • lighteval@huggingface

    Lighteval は、複数のバックエンドで LLM を評価するためのオールインワンツールキットです。

    2,530+8直近 7 日のスター増減
  • evaluate@huggingface

    🤗 Evaluate: 機械学習モデルとデータセットを簡単に評価するためのライブラリ

    2,480+2直近 7 日のスター増減
  • uptrain@uptrain-ai

    UpTrainは、生成AIアプリケーションを評価および改善するためのオープンソースの統合プラットフォームです。20種類以上の事前設定されたチェック(言語、コード、埋め込みのユースケースをカバー)の評価を提供し、失敗事例の根本原因分析を行い、その解決方法についてのインサイトを提供します。

    2,364+3直近 7 日のスター増減
  • graph-rag-agent@1517005260

    GraphRAG、LightRAG、Neo4j-llm-graph-builderを統合して知識グラフの構築と検索を行い、DeepSearch技術を組み込んでプライベートRAGの推論を実現するシステム。GraphRAG向けの独自の評価フレームワークも備えています。

    2,330+8直近 7 日のスター増減
  • fable-method@Sahir619

    Fable Workflow:Claude Fable 5の仕組みを、あらゆるモデルが実行できるスキルへと昇華させ、その正確性を保つ評価機能を備えたもの。思考・実行・検証のプロセス。

    2,267+23直近 7 日のスター増減
  • inspector@MCPJam

    MCP サーバー、MCP アプリ、ChatGPT アプリのチャット、検査、デバッグを行うためのテスト・評価プラットフォーム。

    2,177+23直近 7 日のスター増減
  • 📰 LLM ベースの長文脈モデリングに関する必読論文とブログ 🔥

    2,165+2直近 7 日のスター増減
← トピック一覧に戻る