llm-evaluation
llm-evaluation がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
llm-evaluation と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、llm-evaluation がタグ付けされたリポジトリ。
- #1
AIエージェントの構築と評価に最適なリソース(論文、ブログ、講演、ツール、ベンチマーク)を集めた、無駄のない厳選ライブラリ。BenchFlowが保守しています。
★ 865 - #2
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 594 - #3
Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.
★ 352 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
🪢 オープンソースのAIエンジニアリングプラットフォーム:LLM評価、オブザーバビリティ、メトリクス、プロンプト管理、プレイグラウンド、データセット。OpenTelemetry、LangChain、OpenAI SDK、LiteLLMなどと統合。🍊YC W23
★ 34,116+207直近 7 日のスター増減 - #2
エージェント、LLM、MLモデルのためのオープンソースAIエンジニアリングプラットフォーム。MLflowは、あらゆる規模のチームがコストを管理し、モデルとデータへのアクセスを管理しながら、本番品質のAIアプリケーションをデバッグ、評価、監視、最適化できるようにします。
★ 27,783+55直近 7 日のスター増減 - #3
プロンプト、エージェント、RAGをテスト。AI向けのレッドチーミング/ペネトレーションテスト/脆弱性スキャン。GPT、Claude、Gemini、DeepSeekなどのパフォーマンスを比較。コマンドラインおよびCI/CD統合を備えたシンプルな宣言的設定。OpenAIおよびAnthropicによって使用されています。
★ 24,767+103直近 7 日のスター増減 - #4★ 21,752+84直近 7 日のスター増減
- #5★ 18,063+110直近 7 日のスター増減
- #6
AIエージェントの独立監査。人間またはエージェント自身が実行し、AIエージェント経済における最も重要な問いに答えます。エージェントは意図した通りに動作しているか?iFixAiを使えば、120秒未満でこの答えを得られます。
★ 12,643+1,247直近 7 日のスター増減 - #7★ 11,298+55直近 7 日のスター増減
- #8★ 9,094+23直近 7 日のスター増減
- #9
NoneLinear - ReLE評価:中国語AI大規模言語モデル能力評価(継続更新):現在374のLLMを網羅しており、ChatGPT、GPT-5.4、Google Gemini-3.1-Pro、Claude-4.6、文心ERNIE-X1.1、ERNIE-5.0、Qwen3.6-Max、Qwen3.6-Plus、百川、讯飞星火、商汤SenseChatなどの商用モデル、およびstep3.5-flash、Kimi-K2.6、ERNIE4.5、MiniMax-M2.7、DeepSeek-V4、Qwen3.6、Llama4、智谱GLM-5.1、MiMo-V2、LongCat、Gemma4、MistralなどのオープンソースLLMをカバーしています。ランキングを提供するだけでなく、200万を超える大規模モデルの欠陥ライブラリも提供!コミュニティがLLMの研究、分析、改善を容易にします。
★ 6,415+6直近 7 日のスター増減 - #10★ 6,127+11直近 7 日のスター増減
- #11
Agent Scan、Skills Scan、MCP scan、AI Infra scan、LLM jailbreak評価を介してAIエコシステムを保護するフルスタックAIレッドチーミングプラットフォーム。
★ 6,117+59直近 7 日のスター増減 - #12
🐢 LLMエージェント向けのオープンソースの評価・テストライブラリ
★ 5,801+9直近 7 日のスター増減 - #13
Agent OS:エージェントが自律的に賢くなります。我々は単にラインを維持するだけです。評価コマンドと期待される結果は、渡される成功契約には決して含まれません。面接ゲート付き、段階的評価、予算化された進化ループ。MCPサーバー、13のランタイム:Claude Code、Codex CLI、Gemini CLI、OpenCode、Copilot、Kiroなど。
★ 5,753+25直近 7 日のスター増減 - #14
LLMの実践ガイド:基礎からLLMOpsのベストプラクティスを用いた高度なLLMおよびRAGアプリのAWSへのデプロイまで
★ 5,310+8直近 7 日のスター増減 - #15★ 5,058+1直近 7 日のスター増減
- #16★ 4,390+7直近 7 日のスター増減
- #17
物語やモデルを構築するための科学的手法、プロセス、アルゴリズム、システムのコレクション。
★ 3,676+2直近 7 日のスター増減 - #18★ 3,530+2直近 7 日のスター増減
- #19★ 3,219+9直近 7 日のスター増減
- #20
詳細なロードマップ、プロジェクト、ユースケース、面接対策、コーディング対策を含む、Generative AI に関する包括的なリソース
★ 2,610+1直近 7 日のスター増減 - #21
Agentic な LLM 脆弱性スキャナー / AI レッドチーミングキット 🧪
★ 1,983+3直近 7 日のスター増減 - #22
LLM および AI エージェントアプリケーションの評価、モニタリング、改善のためのオープンソースのエンドツーエンドプラットフォーム。トレーシング、評価、シミュレーション、データセット、ゲートウェイ、ガードレールに対応。セルフホスト可能。Apache 2.0。
★ 1,909+42直近 7 日のスター増減 - #23★ 1,641-1直近 7 日のスター増減
- #24
自動 LLM ファジングのための強力なツール。開発者やセキュリティ研究者が LLM API における潜在的な脱獄(ジェイルブレイク)を特定し、軽減するのに役立つよう設計されています。
★ 1,573+4直近 7 日のスター増減 - #25
Promptyを使うと、AIアプリケーション向けのLLMプロンプトの作成、管理、デバッグ、評価が簡単になります。Promptyは、開発者のための可観測性、可読性、ポータビリティを向上させるために設計された、LLMプロンプトの資産クラスおよびフォーマットです。
★ 1,255+1直近 7 日のスター増減 - #26★ 1,194+1直近 7 日のスター増減
- #27
AIエージェント向けのトレースネイティブなCI/CD — 本番環境のエラーをPRをブロックする回帰テストに変換します。自動検出、クラスタリング、独立したケースへの固定、CIでのゼロコスト再実行を行います。
★ 1,176-22直近 7 日のスター増減 - #28★ 1,060+2直近 7 日のスター増減
- #29
レジリエントなワークフロー、根拠に基づく RAG、バージョン管理されたレポート、自動品質評価を備えた AI 株式調査エージェント。
★ 1,031-2直近 7 日のスター増減 - #30
AIエージェントの構築と評価に最適なリソース(論文、ブログ、講演、ツール、ベンチマーク)を集めた、無駄のない厳選ライブラリ。BenchFlowが保守しています。
★ 865+17直近 7 日のスター増減