メインコンテンツへスキップ
buildradar
Sign in
トピック · evals

evals

evals がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
22
総スター数
86,828
平均スター数
3,947
シェア
0.00%

evals と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、evals がタグ付けされたリポジトリ。

  • waku-agent@ShenSeanChen

    Waku Waku! Waku Agent は、ループ、メモリ、評価をすべてコード内に含み、成長しても読みやすく維持される、自分で完全所有するローカルファーストの AI エージェントハーネスです。

    1,649
  • paperthin@LilMGenius

    Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.

    1,071
  • awesome-evals@benchflow-ai

    AIエージェントの構築と評価に最適なリソース(論文、ブログ、講演、ツール、ベンチマーク)を集めた、無駄のない厳選ライブラリ。BenchFlowが保守しています。

    864
  • ai-engineer-notebooks@calmrocks

    Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.

    612
  • eval@frontier-harness-eval

    Public results and task definitions for FrontierHarness Eval

    151
  • mastra@mastra-ai

    MastraはAIを活用したアプリケーションおよびエージェントのためのモダンなTypeScriptフレームワークである。

    27,657+96直近 7 日のスター増減
  • phoenix@Arize-ai

    AIの可観測性(Observability)と評価

    11,298+55直近 7 日のスター増減
  • agentops@AgentOps-AI

    AIエージェントの監視、LLMコスト追跡、ベンチマークなどを行うためのPython SDK。CrewAI、Agno、OpenAI Agents SDK、Langchain、Autogen、AG2、CamelAIなど、ほとんどのLLMおよびエージェントフレームワークと統合可能です。

    5,808+3直近 7 日のスター増減
  • Kiln@Kiln-AI

    AIシステムの構築、評価、最適化。evals、RAG、エージェント、ファインチューニング、合成データ生成、データセット管理、MCPなどを含む。

    5,042+5直近 7 日のスター増減
  • harbor@harbor-framework

    エージェントを評価・改善するためのフレームワーク

    4,884+120直近 7 日のスター増減
  • logfire@pydantic

    本番環境のLLMおよびエージェントシステム向けAIオブザーバビリティプラットフォーム。

    4,450+4直近 7 日のスター増減
  • trulens@truera

    LLM 実験および AI エージェント向けの評価と追跡フレームワーク

    3,530+2直近 7 日のスター増減
  • lmnr@lmnr-ai

    Laminar - AIエージェント向けに特化して構築されたオープンソースのオブザーバビリティプラットフォーム。YC S24。

    3,219+9直近 7 日のスター増減
  • 本番環境のAIシステムと評価(evals)を構築するエンジニアのためのAIシステム設計ガイド

    2,978+59直近 7 日のスター増減
  • agent-skills-platform@FrancyJGLisboa

    あらゆるワークフローを再利用可能なAIエージェントスキルに変換し、Claude Code、Copilot、Cursor、Windsurf、Codex、Gemini、Kiroなど17のプラットフォームにインストール。1つのSKILL.mdであらゆるプラットフォームに対応。

    2,371+20直近 7 日のスター増減
  • inspector@MCPJam

    MCP サーバー、MCP アプリ、ChatGPT アプリのチャット、検査、デバッグを行うためのテスト・評価プラットフォーム。

    2,183+6直近 7 日のスター増減
  • failproofai@FailproofAI

    AIエージェントハーネスの可観測性とエンフォースメント。ポリシーエンフォースメントにより、すべての実行とランタイムの信頼性をキャプチャします。40の組み込みポリシー、ローカルダッシュボードを備え、アカウント不要で手厚い無料クラウドプランを利用できます。

    1,719+203直近 7 日のスター増減
  • evalite@mattpocock

    TypeScript を使用して LLM 駆動型アプリを評価する。

    1,673+3直近 7 日のスター増減
  • waku-agent@ShenSeanChen

    Waku Waku! Waku Agent は、ループ、メモリ、評価をすべてコード内に含み、成長しても読みやすく維持される、自分で完全所有するローカルファーストの AI エージェントハーネスです。

    1,649+41直近 7 日のスター増減
  • simba@GitHamza0206

    評価とモニタリング機能が組み込まれた、本番環境対応のオープンソースカスタマーサービス

    1,539+1直近 7 日のスター増減
  • raglite@superlinear-ai

    🥤 RAGLiteは、DuckDBまたはPostgreSQLを使用したRetrieval-Augmented Generation(RAG)のためのPythonツールキットです。

    1,200+1直近 7 日のスター増減
  • Tracely-ai@Jwuthri

    AIエージェント向けのトレースネイティブなCI/CD — 本番環境のエラーをPRをブロックする回帰テストに変換します。自動検出、クラスタリング、独立したケースへの固定、CIでのゼロコスト再実行を行います。

    1,176-22直近 7 日のスター増減
  • heym@heymrun

    エージェント型システムを構築し、確実に実行します。エージェントのオーケストレーション、ビジネスプロセスの自動化、全実行の検査、人間による制御の維持を実現します。Heym を独自のインフラストラクチャにデプロイできます。

    1,105+55直近 7 日のスター増減
  • paperthin@LilMGenius

    Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.

    1,071+174直近 7 日のスター増減
  • SkillForge@tripleyak

    スキルが動作することを証明するスキル作成ツール。Claude Code および Codex 向けの根拠駆動型スキル作成機能:ベースラインテスト済み生成、スキルごとの回帰評価、エコシステムチェッカー、クロスランタイムコンパイル、オプトイン式のプロアクティブアドバイザー。

    885+0直近 7 日のスター増減
  • awesome-evals@benchflow-ai

    AIエージェントの構築と評価に最適なリソース(論文、ブログ、講演、ツール、ベンチマーク)を集めた、無駄のない厳選ライブラリ。BenchFlowが保守しています。

    864+17直近 7 日のスター増減
  • ai-engineer-notebooks@calmrocks

    Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.

    612直近 7 日のスター増減
← トピック一覧に戻る