evals
evals がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
evals と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、evals がタグ付けされたリポジトリ。
- #1
Waku Waku! Waku Agent は、ループ、メモリ、評価をすべてコード内に含み、成長しても読みやすく維持される、自分で完全所有するローカルファーストの AI エージェントハーネスです。
★ 1,649 - #2
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 1,071 - #3
AIエージェントの構築と評価に最適なリソース(論文、ブログ、講演、ツール、ベンチマーク)を集めた、無駄のない厳選ライブラリ。BenchFlowが保守しています。
★ 864 - #4
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 612 - #5★ 151
- #1★ 27,657+96直近 7 日のスター増減
- #2★ 11,298+55直近 7 日のスター増減
- #3
AIエージェントの監視、LLMコスト追跡、ベンチマークなどを行うためのPython SDK。CrewAI、Agno、OpenAI Agents SDK、Langchain、Autogen、AG2、CamelAIなど、ほとんどのLLMおよびエージェントフレームワークと統合可能です。
★ 5,808+3直近 7 日のスター増減 - #4★ 5,042+5直近 7 日のスター増減
- #5★ 4,884+120直近 7 日のスター増減
- #6★ 4,450+4直近 7 日のスター増減
- #7★ 3,530+2直近 7 日のスター増減
- #8★ 3,219+9直近 7 日のスター増減
- #9
本番環境のAIシステムと評価(evals)を構築するエンジニアのためのAIシステム設計ガイド
★ 2,978+59直近 7 日のスター増減 - #10
あらゆるワークフローを再利用可能なAIエージェントスキルに変換し、Claude Code、Copilot、Cursor、Windsurf、Codex、Gemini、Kiroなど17のプラットフォームにインストール。1つのSKILL.mdであらゆるプラットフォームに対応。
★ 2,371+20直近 7 日のスター増減 - #11★ 2,183+6直近 7 日のスター増減
- #12
AIエージェントハーネスの可観測性とエンフォースメント。ポリシーエンフォースメントにより、すべての実行とランタイムの信頼性をキャプチャします。40の組み込みポリシー、ローカルダッシュボードを備え、アカウント不要で手厚い無料クラウドプランを利用できます。
★ 1,719+203直近 7 日のスター増減 - #13★ 1,673+3直近 7 日のスター増減
- #14
Waku Waku! Waku Agent は、ループ、メモリ、評価をすべてコード内に含み、成長しても読みやすく維持される、自分で完全所有するローカルファーストの AI エージェントハーネスです。
★ 1,649+41直近 7 日のスター増減 - #15★ 1,539+1直近 7 日のスター増減
- #16
🥤 RAGLiteは、DuckDBまたはPostgreSQLを使用したRetrieval-Augmented Generation(RAG)のためのPythonツールキットです。
★ 1,200+1直近 7 日のスター増減 - #17
AIエージェント向けのトレースネイティブなCI/CD — 本番環境のエラーをPRをブロックする回帰テストに変換します。自動検出、クラスタリング、独立したケースへの固定、CIでのゼロコスト再実行を行います。
★ 1,176-22直近 7 日のスター増減 - #18
エージェント型システムを構築し、確実に実行します。エージェントのオーケストレーション、ビジネスプロセスの自動化、全実行の検査、人間による制御の維持を実現します。Heym を独自のインフラストラクチャにデプロイできます。
★ 1,105+55直近 7 日のスター増減 - #19
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 1,071+174直近 7 日のスター増減 - #20
スキルが動作することを証明するスキル作成ツール。Claude Code および Codex 向けの根拠駆動型スキル作成機能:ベースラインテスト済み生成、スキルごとの回帰評価、エコシステムチェッカー、クロスランタイムコンパイル、オプトイン式のプロアクティブアドバイザー。
★ 885+0直近 7 日のスター増減 - #21
AIエージェントの構築と評価に最適なリソース(論文、ブログ、講演、ツール、ベンチマーク)を集めた、無駄のない厳選ライブラリ。BenchFlowが保守しています。
★ 864+17直近 7 日のスター増減 - #22
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 612—直近 7 日のスター増減