evaluation
evaluation がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
evaluation と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、evaluation がタグ付けされたリポジトリ。
- #1
Fable Workflow:Claude Fable 5の仕組みを、あらゆるモデルが実行できるスキルへと昇華させ、その正確性を保つ評価機能を備えたもの。思考・実行・検証のプロセス。
★ 2,267 - #2
AIエージェント向けのトレースネイティブなCI/CD — 本番環境のエラーをPRをブロックする回帰テストに変換します。自動検出、クラスタリング、独立したケースへの固定、CIでのゼロコスト再実行を行います。
★ 1,159 - #3
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
★ 256 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
🪢 オープンソースのAIエンジニアリングプラットフォーム:LLM評価、オブザーバビリティ、メトリクス、プロンプト管理、プレイグラウンド、データセット。OpenTelemetry、LangChain、OpenAI SDK、LiteLLMなどと統合。🍊YC W23
★ 33,909+372直近 7 日のスター増減 - #2
エージェント、LLM、MLモデルのためのオープンソースAIエンジニアリングプラットフォーム。MLflowは、あらゆる規模のチームがコストを管理し、モデルとデータへのアクセスを管理しながら、本番品質のAIアプリケーションをデバッグ、評価、監視、最適化できるようにします。
★ 27,728+114直近 7 日のスター増減 - #3
プロンプト、エージェント、RAGをテスト。AI向けのレッドチーミング/ペネトレーションテスト/脆弱性スキャン。GPT、Claude、Gemini、DeepSeekなどのパフォーマンスを比較。コマンドラインおよびCI/CD統合を備えたシンプルな宣言的設定。OpenAIおよびAnthropicによって使用されています。
★ 24,664+215直近 7 日のスター増減 - #4★ 21,668+143直近 7 日のスター増減
- #5★ 20,899+581直近 7 日のスター増減
- #6★ 15,541+123直近 7 日のスター増減
- #7★ 9,380+3直近 7 日のスター増減
- #8
OpenCompassはLLM評価プラットフォームであり、100以上のデータセットで幅広いモデル(Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claudeなど)をサポートしています。
★ 7,374+48直近 7 日のスター増減 - #9★ 6,116+23直近 7 日のスター増減
- #10
次世代AIエージェント最適化プラットフォーム:Cozeloopは、開発、デバッグ、評価から監視に至るまでのライフサイクル全体管理機能を提供することで、AIエージェント開発の課題に対処します。
★ 5,706+7直近 7 日のスター増減 - #11★ 5,057+7直近 7 日のスター増減
- #12★ 5,037+7直近 7 日のスター増減
- #13★ 4,383+11直近 7 日のスター増減
- #14
大規模マルチモーダルモデル (LMMs) のオープンソース評価ツールキット。220以上のLMM、80以上のベンチマークをサポート。
★ 4,362+10直近 7 日のスター増減 - #15★ 4,310+7直近 7 日のスター増減
- #16★ 3,517+13直近 7 日のスター増減
- #17★ 3,409+9直近 7 日のスター増減
- #18★ 3,331+47直近 7 日のスター増減
- #19★ 3,299-1直近 7 日のスター増減
- #20★ 3,210+24直近 7 日のスター増減
- #21★ 3,134+0直近 7 日のスター増減
- #22
LLMプロンプトの耐久テストを行うためのオープンソースのビジュアルプログラミング環境。
★ 3,028+1直近 7 日のスター増減 - #23
YAO = Yielding AI Outcomes。再利用可能なエージェントスキルのための、厳密なエンジニアリング、評価、ガバナンス、およびポータビリティシステム。
★ 2,557+160直近 7 日のスター増減 - #24★ 2,530+8直近 7 日のスター増減
- #25★ 2,480+2直近 7 日のスター増減
- #26
UpTrainは、生成AIアプリケーションを評価および改善するためのオープンソースの統合プラットフォームです。20種類以上の事前設定されたチェック(言語、コード、埋め込みのユースケースをカバー)の評価を提供し、失敗事例の根本原因分析を行い、その解決方法についてのインサイトを提供します。
★ 2,364+3直近 7 日のスター増減 - #27
GraphRAG、LightRAG、Neo4j-llm-graph-builderを統合して知識グラフの構築と検索を行い、DeepSearch技術を組み込んでプライベートRAGの推論を実現するシステム。GraphRAG向けの独自の評価フレームワークも備えています。
★ 2,330+8直近 7 日のスター増減 - #28
Fable Workflow:Claude Fable 5の仕組みを、あらゆるモデルが実行できるスキルへと昇華させ、その正確性を保つ評価機能を備えたもの。思考・実行・検証のプロセス。
★ 2,267+23直近 7 日のスター増減 - #29★ 2,177+23直近 7 日のスター増減
- #30
📰 LLM ベースの長文脈モデリングに関する必読論文とブログ 🔥
★ 2,165+2直近 7 日のスター増減