Zum Hauptinhalt springen
buildradar
Sign in
Thema · evals

evals

Erfasste Open-Source-Repos mit dem Tag evals, sortiert nach Sternen.

Repos
22
Sterne gesamt
85.449
Sterne im Schnitt
3.884
Anteil
0,00%

Themen, die häufig gemeinsam mit evals am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit evals getaggt wurden.

  • waku-agent@ShenSeanChen

    Waku Waku! Waku Agent ist ein lokal orientiertes KI-Agenten-Framework, das Ihnen wirklich gehört, einschließlich Schleife, Speicher und Evaluierung – alles in Code, der auch bei Wachstum übersichtlich bleibt.

    1.621
  • Tracely-ai@Jwuthri

    Trace-native CI/CD für KI-Agenten — Produktionsfehler werden zu Regressionstests, die den PR blockieren. Automatisch erkennen, clustern, in hermetische Fälle einfrieren und für 0 $ in CI wiederholen.

    1.159
  • paperthin@LilMGenius

    Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.

    912
  • awesome-evals@benchflow-ai

    Eine kuratierte, direkte Sammlung der besten Ressourcen zum Erstellen und Evaluieren von KI-Agenten – Paper, Blogs, Vorträge, Tools, Benchmarks. Gepflegt von BenchFlow.

    849
  • ai-engineer-notebooks@calmrocks

    Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.

    552
  • mastra@mastra-ai

    Mastra ist das moderne TypeScript-Framework für KI-gestützte Anwendungen und Agenten.

    27.561+204Sterne-Änderung der letzten 7 Tage
  • phoenix@Arize-ai

    KI-Observability & Evaluierung

    11.243+101Sterne-Änderung der letzten 7 Tage
  • agentops@AgentOps-AI

    Python-SDK für KI-Agenten-Monitoring, LLM-Kostenverfolgung, Benchmarking und mehr. Integriert sich in die meisten LLMs und Agenten-Frameworks, einschließlich CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2 und CamelAI

    5.805+16Sterne-Änderung der letzten 7 Tage
  • Kiln@Kiln-AI

    KI-Systeme entwickeln, bewerten und optimieren. Beinhaltet Evaluierungen, RAG, Agenten, Fine-Tuning, synthetische Datenerzeugung, Dataset-Management, MCP und mehr.

    5.037+7Sterne-Änderung der letzten 7 Tage
  • harbor@harbor-framework

    Framework zur Evaluierung und Verbesserung von Agenten

    4.764+256Sterne-Änderung der letzten 7 Tage
  • logfire@pydantic

    KI-Beobachtbarkeitsplattform für LLM- und Agentensysteme in der Produktion.

    4.446+14Sterne-Änderung der letzten 7 Tage
  • trulens@truera

    Evaluierung und Tracking für LLM-Experimente und KI-Agenten

    3.528+10Sterne-Änderung der letzten 7 Tage
  • lmnr@lmnr-ai

    Laminar – eine Open-Source-Observability-Plattform, speziell entwickelt für KI-Agenten. YC S24.

    3.210+24Sterne-Änderung der letzten 7 Tage
  • Leitfaden zum KI-Systemdesign für Ingenieure, die KI-Produktionssysteme und -Evaluierungen entwickeln.

    2.919+221Sterne-Änderung der letzten 7 Tage
  • agent-skill-creator@FrancyJGLisboa

    Verwandeln Sie jeden Workflow in wiederverwendbare KI-Agenten-Fähigkeiten, die auf 17 Plattformen installiert werden können – Claude Code, Copilot, Cursor, Windsurf, Codex, Gemini, Kiro und mehr. Ein SKILL.md für jede Plattform.

    2.356+56Sterne-Änderung der letzten 7 Tage
  • inspector@MCPJam

    Test- und Evaluierungsplattform zum Chatten, Inspizieren und Debuggen von MCP-Servern, MCP-Apps und ChatGPT-Apps.

    2.177+23Sterne-Änderung der letzten 7 Tage
  • evalite@mattpocock

    Evaluiere deine LLM-basierten Apps mit TypeScript

    1.672+8Sterne-Änderung der letzten 7 Tage
  • waku-agent@ShenSeanChen

    Waku Waku! Waku Agent ist ein lokal orientiertes KI-Agenten-Framework, das Ihnen wirklich gehört, einschließlich Schleife, Speicher und Evaluierung – alles in Code, der auch bei Wachstum übersichtlich bleibt.

    1.621+89Sterne-Änderung der letzten 7 Tage
  • failproofai@FailproofAI

    Observability und Durchsetzung für KI-Agenten-Frameworks. Erfassung jedes Laufs und der Laufzeitzuverlässigkeit mit Richtliniendurchsetzung. 40 integrierte Richtlinien, ein lokales Dashboard, kein Konto erforderlich und ein großzügiger kostenloser Cloud-Tarif.

    1.543+215Sterne-Änderung der letzten 7 Tage
  • simba@GitHamza0206

    Open-Source-Kundenservice für die Produktion mit integrierten Auswertungen und Monitoring

    1.538+3Sterne-Änderung der letzten 7 Tage
  • raglite@superlinear-ai

    🥤 RAGLite ist ein Python-Toolkit für Retrieval-Augmented Generation (RAG) mit DuckDB oder PostgreSQL

    1.200+1Sterne-Änderung der letzten 7 Tage
  • Tracely-ai@Jwuthri

    Trace-native CI/CD für KI-Agenten — Produktionsfehler werden zu Regressionstests, die den PR blockieren. Automatisch erkennen, clustern, in hermetische Fälle einfrieren und für 0 $ in CI wiederholen.

    1.159+331Sterne-Änderung der letzten 7 Tage
  • heym@heymrun

    Erstellen Sie agentenbasierte Systeme. Führen Sie sie sicher aus. Orchestrieren Sie Agenten, automatisieren Sie Geschäftsprozesse, inspizieren Sie jede Ausführung und behalten Sie die menschliche Kontrolle. Deployen Sie Heym auf Ihrer eigenen Infrastruktur.

    1.057+87Sterne-Änderung der letzten 7 Tage
  • paperthin@LilMGenius

    Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.

    912Sterne-Änderung der letzten 7 Tage
  • SkillForge@tripleyak

    Ein Skill-Ersteller, der nachweist, dass seine Skills funktionieren. Evidenzbasierte Skill-Erstellung für Claude Code und Codex: basislinengeprüfte Generierung, regressionsgetriebene Evaluierungen pro Skill, Ökosystem-Doctor, Laufzeitübergreifender Compiler und optionaler proaktiver Berater.

    885+9Sterne-Änderung der letzten 7 Tage
  • awesome-evals@benchflow-ai

    Eine kuratierte, direkte Sammlung der besten Ressourcen zum Erstellen und Evaluieren von KI-Agenten – Paper, Blogs, Vorträge, Tools, Benchmarks. Gepflegt von BenchFlow.

    849+10Sterne-Änderung der letzten 7 Tage
  • ai-engineer-notebooks@calmrocks

    Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.

    552Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen