メインコンテンツへスキップ
buildradar
Sign in
トピック · llm-evaluation

llm-evaluation

llm-evaluation がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
37
総スター数
234,912
平均スター数
6,349
シェア
0.01%

llm-evaluation と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、llm-evaluation がタグ付けされたリポジトリ。

  • awesome-evals@benchflow-ai

    AIエージェントの構築と評価に最適なリソース(論文、ブログ、講演、ツール、ベンチマーク)を集めた、無駄のない厳選ライブラリ。BenchFlowが保守しています。

    865
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594
  • KADATH@i3T4AN

    Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.

    352
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    🪢 オープンソースのAIエンジニアリングプラットフォーム:LLM評価、オブザーバビリティ、メトリクス、プロンプト管理、プレイグラウンド、データセット。OpenTelemetry、LangChain、OpenAI SDK、LiteLLMなどと統合。🍊YC W23

    34,116+207直近 7 日のスター増減
  • mlflow@mlflow

    エージェント、LLM、MLモデルのためのオープンソースAIエンジニアリングプラットフォーム。MLflowは、あらゆる規模のチームがコストを管理し、モデルとデータへのアクセスを管理しながら、本番品質のAIアプリケーションをデバッグ、評価、監視、最適化できるようにします。

    27,783+55直近 7 日のスター増減
  • promptfoo@promptfoo

    プロンプト、エージェント、RAGをテスト。AI向けのレッドチーミング/ペネトレーションテスト/脆弱性スキャン。GPT、Claude、Gemini、DeepSeekなどのパフォーマンスを比較。コマンドラインおよびCI/CD統合を備えたシンプルな宣言的設定。OpenAIおよびAnthropicによって使用されています。

    24,767+103直近 7 日のスター増減
  • opik@comet-ml

    包括的なトレーシング、自動評価、本番環境対応のダッシュボードにより、LLMアプリケーション、RAGシステム、エージェンティックワークフローをデバッグ、評価、監視できます。

    21,752+84直近 7 日のスター増減
  • deepeval@confident-ai

    LLM評価フレームワーク

    18,063+110直近 7 日のスター増減
  • iFixAi@ifixai-ai

    AIエージェントの独立監査。人間またはエージェント自身が実行し、AIエージェント経済における最も重要な問いに答えます。エージェントは意図した通りに動作しているか?iFixAiを使えば、120秒未満でこの答えを得られます。

    12,643+1,247直近 7 日のスター増減
  • phoenix@Arize-ai

    AIの可観測性(Observability)と評価

    11,298+55直近 7 日のスター増減
  • garak@NVIDIA

    LLMの脆弱性スキャナー

    9,094+23直近 7 日のスター増減
  • NoneLinear - ReLE評価:中国語AI大規模言語モデル能力評価(継続更新):現在374のLLMを網羅しており、ChatGPT、GPT-5.4、Google Gemini-3.1-Pro、Claude-4.6、文心ERNIE-X1.1、ERNIE-5.0、Qwen3.6-Max、Qwen3.6-Plus、百川、讯飞星火、商汤SenseChatなどの商用モデル、およびstep3.5-flash、Kimi-K2.6、ERNIE4.5、MiniMax-M2.7、DeepSeek-V4、Qwen3.6、Llama4、智谱GLM-5.1、MiMo-V2、LongCat、Gemma4、MistralなどのオープンソースLLMをカバーしています。ランキングを提供するだけでなく、200万を超える大規模モデルの欠陥ライブラリも提供!コミュニティがLLMの研究、分析、改善を容易にします。

    6,415+6直近 7 日のスター増減
  • helicone@Helicone

    🧊 オープンソースのLLMオブザーバビリティプラットフォーム。1行のコードで監視、評価、実験が可能。YC W23 🍓

    6,127+11直近 7 日のスター増減
  • AI-Infra-Guard@Tencent

    Agent Scan、Skills Scan、MCP scan、AI Infra scan、LLM jailbreak評価を介してAIエコシステムを保護するフルスタックAIレッドチーミングプラットフォーム。

    6,117+59直近 7 日のスター増減
  • giskard-oss@Giskard-AI

    🐢 LLMエージェント向けのオープンソースの評価・テストライブラリ

    5,801+9直近 7 日のスター増減
  • ouroboros@Q00

    Agent OS:エージェントが自律的に賢くなります。我々は単にラインを維持するだけです。評価コマンドと期待される結果は、渡される成功契約には決して含まれません。面接ゲート付き、段階的評価、予算化された進化ループ。MCPサーバー、13のランタイム:Claude Code、Codex CLI、Gemini CLI、OpenCode、Copilot、Kiroなど。

    5,753+25直近 7 日のスター増減
  • LLM-Engineers-Handbook@PacktPublishing

    LLMの実践ガイド:基礎からLLMOpsのベストプラクティスを用いた高度なLLMおよびRAGアプリのAWSへのデプロイまで

    5,310+8直近 7 日のスター増減
  • AutoRAG@Marker-Inc-Korea

    AutoRAG:これでエージェントはコンピューター内のあらゆるものを検索できます。頻繁に使用するほど、より賢くなります。

    5,058+1直近 7 日のスター増減
  • lmms-eval@EvolvingLMMs-Lab

    テキスト、画像、ビデオ、オーディオタスクを網羅するオールインワンのマルチモーダル評価ツールキット

    4,390+7直近 7 日のスター増減
  • AI-Engineer-Headquarters@hemansnation

    物語やモデルを構築するための科学的手法、プロセス、アルゴリズム、システムのコレクション。

    3,676+2直近 7 日のスター増減
  • trulens@truera

    LLM 実験および AI エージェント向けの評価と追跡フレームワーク

    3,530+2直近 7 日のスター増減
  • lmnr@lmnr-ai

    Laminar - AIエージェント向けに特化して構築されたオープンソースのオブザーバビリティプラットフォーム。YC S24。

    3,219+9直近 7 日のスター増減
  • generative-ai@genieincodebottle

    詳細なロードマップ、プロジェクト、ユースケース、面接対策、コーディング対策を含む、Generative AI に関する包括的なリソース

    2,610+1直近 7 日のスター増減
  • agentic_security@msoedov

    Agentic な LLM 脆弱性スキャナー / AI レッドチーミングキット 🧪

    1,983+3直近 7 日のスター増減
  • future-agi@future-agi

    LLM および AI エージェントアプリケーションの評価、モニタリング、改善のためのオープンソースのエンドツーエンドプラットフォーム。トレーシング、評価、シミュレーション、データセット、ゲートウェイ、ガードレールに対応。セルフホスト可能。Apache 2.0。

    1,909+42直近 7 日のスター増減
  • aisheets@huggingface

    ノーコードで AI モデルを使用してデータセットを構築、拡張、変換

    1,641-1直近 7 日のスター増減
  • FuzzyAI@cyberark

    自動 LLM ファジングのための強力なツール。開発者やセキュリティ研究者が LLM API における潜在的な脱獄(ジェイルブレイク)を特定し、軽減するのに役立つよう設計されています。

    1,573+4直近 7 日のスター増減
  • prompty@microsoft

    Promptyを使うと、AIアプリケーション向けのLLMプロンプトの作成、管理、デバッグ、評価が簡単になります。Promptyは、開発者のための可観測性、可読性、ポータビリティを向上させるために設計された、LLMプロンプトの資産クラスおよびフォーマットです。

    1,255+1直近 7 日のスター増減
  • uqlm@cvs-health

    [JMLR 2026] 「UQLM: 大規模言語モデルの不確実性定量化のためのPythonパッケージ」

    1,194+1直近 7 日のスター増減
  • Tracely-ai@Jwuthri

    AIエージェント向けのトレースネイティブなCI/CD — 本番環境のエラーをPRをブロックする回帰テストに変換します。自動検出、クラスタリング、独立したケースへの固定、CIでのゼロコスト再実行を行います。

    1,176-22直近 7 日のスター増減
  • judgeval@JudgmentLabs

    エージェントのための継続的改善スタック。環境データと評価機能により、エージェントの改善とモニタリングを駆動します。

    1,060+2直近 7 日のスター増減
  • FinSight-AI@juanjuandog

    レジリエントなワークフロー、根拠に基づく RAG、バージョン管理されたレポート、自動品質評価を備えた AI 株式調査エージェント。

    1,031-2直近 7 日のスター増減
  • awesome-evals@benchflow-ai

    AIエージェントの構築と評価に最適なリソース(論文、ブログ、講演、ツール、ベンチマーク)を集めた、無駄のない厳選ライブラリ。BenchFlowが保守しています。

    865+17直近 7 日のスター増減
← トピック一覧に戻る