evals
Erfasste Open-Source-Repos mit dem Tag evals, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit evals am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit evals getaggt wurden.
- #1
Waku Waku! Waku Agent ist ein lokal orientiertes KI-Agenten-Framework, das Ihnen wirklich gehört, einschließlich Schleife, Speicher und Evaluierung – alles in Code, der auch bei Wachstum übersichtlich bleibt.
★ 1.621 - #2
Trace-native CI/CD für KI-Agenten — Produktionsfehler werden zu Regressionstests, die den PR blockieren. Automatisch erkennen, clustern, in hermetische Fälle einfrieren und für 0 $ in CI wiederholen.
★ 1.159 - #3
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 912 - #4
Eine kuratierte, direkte Sammlung der besten Ressourcen zum Erstellen und Evaluieren von KI-Agenten – Paper, Blogs, Vorträge, Tools, Benchmarks. Gepflegt von BenchFlow.
★ 849 - #5
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 552
- #1
Mastra ist das moderne TypeScript-Framework für KI-gestützte Anwendungen und Agenten.
★ 27.561+204Sterne-Änderung der letzten 7 Tage - #2★ 11.243+101Sterne-Änderung der letzten 7 Tage
- #3
Python-SDK für KI-Agenten-Monitoring, LLM-Kostenverfolgung, Benchmarking und mehr. Integriert sich in die meisten LLMs und Agenten-Frameworks, einschließlich CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2 und CamelAI
★ 5.805+16Sterne-Änderung der letzten 7 Tage - #4
KI-Systeme entwickeln, bewerten und optimieren. Beinhaltet Evaluierungen, RAG, Agenten, Fine-Tuning, synthetische Datenerzeugung, Dataset-Management, MCP und mehr.
★ 5.037+7Sterne-Änderung der letzten 7 Tage - #5★ 4.764+256Sterne-Änderung der letzten 7 Tage
- #6★ 4.446+14Sterne-Änderung der letzten 7 Tage
- #7★ 3.528+10Sterne-Änderung der letzten 7 Tage
- #8
Laminar – eine Open-Source-Observability-Plattform, speziell entwickelt für KI-Agenten. YC S24.
★ 3.210+24Sterne-Änderung der letzten 7 Tage - #9
Leitfaden zum KI-Systemdesign für Ingenieure, die KI-Produktionssysteme und -Evaluierungen entwickeln.
★ 2.919+221Sterne-Änderung der letzten 7 Tage - #10
Verwandeln Sie jeden Workflow in wiederverwendbare KI-Agenten-Fähigkeiten, die auf 17 Plattformen installiert werden können – Claude Code, Copilot, Cursor, Windsurf, Codex, Gemini, Kiro und mehr. Ein SKILL.md für jede Plattform.
★ 2.356+56Sterne-Änderung der letzten 7 Tage - #11
Test- und Evaluierungsplattform zum Chatten, Inspizieren und Debuggen von MCP-Servern, MCP-Apps und ChatGPT-Apps.
★ 2.177+23Sterne-Änderung der letzten 7 Tage - #12★ 1.672+8Sterne-Änderung der letzten 7 Tage
- #13
Waku Waku! Waku Agent ist ein lokal orientiertes KI-Agenten-Framework, das Ihnen wirklich gehört, einschließlich Schleife, Speicher und Evaluierung – alles in Code, der auch bei Wachstum übersichtlich bleibt.
★ 1.621+89Sterne-Änderung der letzten 7 Tage - #14
Observability und Durchsetzung für KI-Agenten-Frameworks. Erfassung jedes Laufs und der Laufzeitzuverlässigkeit mit Richtliniendurchsetzung. 40 integrierte Richtlinien, ein lokales Dashboard, kein Konto erforderlich und ein großzügiger kostenloser Cloud-Tarif.
★ 1.543+215Sterne-Änderung der letzten 7 Tage - #15
Open-Source-Kundenservice für die Produktion mit integrierten Auswertungen und Monitoring
★ 1.538+3Sterne-Änderung der letzten 7 Tage - #16
🥤 RAGLite ist ein Python-Toolkit für Retrieval-Augmented Generation (RAG) mit DuckDB oder PostgreSQL
★ 1.200+1Sterne-Änderung der letzten 7 Tage - #17
Trace-native CI/CD für KI-Agenten — Produktionsfehler werden zu Regressionstests, die den PR blockieren. Automatisch erkennen, clustern, in hermetische Fälle einfrieren und für 0 $ in CI wiederholen.
★ 1.159+331Sterne-Änderung der letzten 7 Tage - #18
Erstellen Sie agentenbasierte Systeme. Führen Sie sie sicher aus. Orchestrieren Sie Agenten, automatisieren Sie Geschäftsprozesse, inspizieren Sie jede Ausführung und behalten Sie die menschliche Kontrolle. Deployen Sie Heym auf Ihrer eigenen Infrastruktur.
★ 1.057+87Sterne-Änderung der letzten 7 Tage - #19
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 912—Sterne-Änderung der letzten 7 Tage - #20
Ein Skill-Ersteller, der nachweist, dass seine Skills funktionieren. Evidenzbasierte Skill-Erstellung für Claude Code und Codex: basislinengeprüfte Generierung, regressionsgetriebene Evaluierungen pro Skill, Ökosystem-Doctor, Laufzeitübergreifender Compiler und optionaler proaktiver Berater.
★ 885+9Sterne-Änderung der letzten 7 Tage - #21
Eine kuratierte, direkte Sammlung der besten Ressourcen zum Erstellen und Evaluieren von KI-Agenten – Paper, Blogs, Vorträge, Tools, Benchmarks. Gepflegt von BenchFlow.
★ 849+10Sterne-Änderung der letzten 7 Tage - #22
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 552—Sterne-Änderung der letzten 7 Tage