Lompat ke konten utama
buildradar
Sign in
Topik · llm-evaluation

llm-evaluation

Repositori open source terpantau bertanda llm-evaluation, diurutkan berdasarkan bintang.

Repositori
37
Total bintang
234.912
Rata-rata bintang
6.349
Porsi
0,01%

Topik yang sering muncul berdampingan dengan llm-evaluation di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda llm-evaluation.

  • awesome-evals@benchflow-ai

    Pustaka pilihan yang berisi sumber daya terbaik untuk membangun dan mengevaluasi AI agent — makalah, blog, ceramah, alat, dan tolok ukur. Dikelola oleh BenchFlow.

    865
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    623
  • KADATH@i3T4AN

    Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.

    352
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    Platform rekayasa AI sumber terbuka: evaluasi LLM, observabilitas, metrik, manajemen prompt, playground, dan dataset. Terintegrasi dengan OpenTelemetry, LangChain, OpenAI SDK, LiteLLM, dan lainnya. 🍊YC W23

    34.116+207Perubahan bintang dalam 7 hari terakhir
  • mlflow@mlflow

    Platform rekayasa AI sumber terbuka untuk agen, LLM, dan model ML. MLflow memungkinkan tim dari berbagai skala untuk men-debug, mengevaluasi, memantau, dan mengoptimalkan aplikasi AI berkualitas produksi sambil mengontrol biaya serta mengelola akses ke model dan data.

    27.783+55Perubahan bintang dalam 7 hari terakhir
  • promptfoo@promptfoo

    Uji prompt, agen, dan RAG Anda. Red teaming/pentesting/pemindaian kerentanan untuk AI. Bandingkan performa GPT, Claude, Gemini, DeepSeek, dan lainnya. Konfigurasi deklaratif sederhana dengan integrasi baris perintah dan CI/CD. Digunakan oleh OpenAI dan Anthropic.

    24.767+103Perubahan bintang dalam 7 hari terakhir
  • opik@comet-ml

    Debug, evaluasi, dan pantau aplikasi LLM, sistem RAG, dan alur kerja agen Anda dengan pelacakan komprehensif, evaluasi otomatis, dan dasbor siap produksi.

    21.752+84Perubahan bintang dalam 7 hari terakhir
  • deepeval@confident-ai

    Kerangka kerja evaluasi LLM

    18.063+110Perubahan bintang dalam 7 hari terakhir
  • iFixAi@ifixai-ai

    Audit independen untuk AI Agent. Dijalankan oleh manusia atau agen itu sendiri untuk menjawab pertanyaan paling krusial dalam Ekonomi AI Agent: Apakah agen melakukan apa yang seharusnya dilakukan? Dengan iFixAi, Anda bisa mendapatkan jawabannya dalam waktu kurang dari 120 detik.

    12.643+1.247Perubahan bintang dalam 7 hari terakhir
  • phoenix@Arize-ai

    Observabilitas & Evaluasi AI.

    11.298+55Perubahan bintang dalam 7 hari terakhir
  • garak@NVIDIA

    Pemindai kerentanan LLM

    9.094+23Perubahan bintang dalam 7 hari terakhir
  • 非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新):目前已囊括374个大模型,覆盖chatgpt、gpt-5.4、谷歌gemini-3.1-pro、Claude-4.6、文心ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤senseChat等商用模型, 以及step3.5-flash、kimi-k2.6、ernie4.5、MiniMax-M2.7、deepseek-v4、Qwen3.6、llama4、智谱GLM-5.1、MiMo-V2、LongCat、gemma4、mistral等开源大模型。不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。

    6.415+6Perubahan bintang dalam 7 hari terakhir
  • helicone@Helicone

    🧊 Platform observabilitas LLM sumber terbuka. Satu baris kode untuk memantau, mengevaluasi, dan bereksperimen. YC W23 🍓

    6.127+11Perubahan bintang dalam 7 hari terakhir
  • AI-Infra-Guard@Tencent

    Platform AI Red Teaming full-stack untuk mengamankan ekosistem AI melalui Agent Scan, Skills Scan, MCP scan, AI Infra scan, dan evaluasi jailbreak LLM.

    6.117+59Perubahan bintang dalam 7 hari terakhir
  • giskard-oss@Giskard-AI

    🐢 Pustaka pengujian dan evaluasi sumber terbuka untuk LLM Agent

    5.801+9Perubahan bintang dalam 7 hari terakhir
  • ouroboros@Q00

    Agent OS: agen menjadi lebih pintar dengan sendirinya. Kami menjaga batas: perintah penilaian dan hasil yang diharapkan tidak pernah masuk ke dalam kontrak kesuksesan yang kami berikan. Evaluasi bertahap yang dibatasi wawancara, perulangan evolusi beranggaran. Server MCP, 13 runtime: Claude Code, Codex CLI, Gemini CLI, OpenCode, Copilot, Kiro, dan lainnya.

    5.753+25Perubahan bintang dalam 7 hari terakhir
  • LLM-Engineers-Handbook@PacktPublishing

    Panduan praktis LLM: Dari dasar-dasar hingga penerapan aplikasi LLM dan RAG tingkat lanjut ke AWS menggunakan praktik terbaik LLMOps

    5.310+8Perubahan bintang dalam 7 hari terakhir
  • AutoRAG@Marker-Inc-Korea

    AutoRAG: Sekarang agen Anda dapat menemukan apa pun di komputer Anda. Menjadi lebih cerdas jika Anda sering menggunakannya.

    5.058+1Perubahan bintang dalam 7 hari terakhir
  • lmms-eval@EvolvingLMMs-Lab

    Toolkit evaluasi multimodal serbaguna untuk tugas teks, gambar, video, dan audio.

    4.390+7Perubahan bintang dalam 7 hari terakhir
  • AI-Engineer-Headquarters@hemansnation

    Kumpulan metode ilmiah, proses, algoritma, dan sistem untuk membangun cerita dan model.

    3.676+2Perubahan bintang dalam 7 hari terakhir
  • trulens@truera

    Evaluasi dan Pelacakan untuk Eksperimen LLM dan Agen AI

    3.530+2Perubahan bintang dalam 7 hari terakhir
  • lmnr@lmnr-ai

    Laminar - platform observabilitas sumber terbuka yang dibuat khusus untuk agen AI. YC S24.

    3.219+9Perubahan bintang dalam 7 hari terakhir
  • generative-ai@genieincodebottle

    Sumber daya komprehensif tentang AI Generatif, termasuk peta jalan terperinci, proyek, kasus penggunaan, persiapan wawancara, dan persiapan pemrograman.

    2.610+1Perubahan bintang dalam 7 hari terakhir
  • agentic_security@msoedov

    Pemindai Kerentanan LLM Agen / Kit red teaming AI 🧪

    1.983+3Perubahan bintang dalam 7 hari terakhir
  • future-agi@future-agi

    Platform sumber terbuka end-to-end untuk mengevaluasi, mengawasi, dan meningkatkan aplikasi LLM dan agen AI. Penelusuran · Evaluasi · Simulasi · Kumpulan Data · Gateway · Guardrails. Dapat di-host sendiri. Apache 2.0.

    1.909+42Perubahan bintang dalam 7 hari terakhir
  • aisheets@huggingface

    Bangun, perkaya, dan ubah dataset menggunakan model AI tanpa kode.

    1.641-1Perubahan bintang dalam 7 hari terakhir
  • FuzzyAI@cyberark

    Alat yang kuat untuk fuzzing LLM otomatis. Dirancang untuk membantu pengembang dan peneliti keamanan mengidentifikasi dan memitigasi potensi jailbreak pada API LLM mereka.

    1.573+4Perubahan bintang dalam 7 hari terakhir
  • prompty@microsoft

    Prompty memudahkan pembuatan, pengelolaan,-debugging, dan evaluasi prompt LLM untuk aplikasi AI Anda. Prompty adalah kelas aset dan format untuk prompt LLM yang dirancang untuk meningkatkan keteramatan, keterpahaman, dan portabilitas bagi pengembang.

    1.255+1Perubahan bintang dalam 7 hari terakhir
  • uqlm@cvs-health

    [JMLR 2026] "UQLM: Paket Python untuk Kuantifikasi Ketidakpastian dalam Large Language Models"

    1.194+1Perubahan bintang dalam 7 hari terakhir
  • Tracely-ai@Jwuthri

    CI/CD berbasis trace untuk agen AI — kegagalan produksi menjadi tes regresi yang memblokir PR. Deteksi otomatis, klasterisasi, pembekuan menjadi kasus hermetik, dan pemutaran ulang di CI dengan biaya $0.

    1.176-22Perubahan bintang dalam 7 hari terakhir
  • judgeval@JudgmentLabs

    Stack Peningkatan Berkelanjutan untuk Agen. Data lingkungan dan evaluasi kami mendukung peningkatan dan pemantauan agen.

    1.060+2Perubahan bintang dalam 7 hari terakhir
  • FinSight-AI@juanjuandog

    Agen riset ekuitas AI dengan alur kerja tangguh, RAG berbasis bukti, laporan versi, dan evaluasi kualitas otomatis.

    1.032-2Perubahan bintang dalam 7 hari terakhir
  • awesome-evals@benchflow-ai

    Pustaka pilihan yang berisi sumber daya terbaik untuk membangun dan mengevaluasi AI agent — makalah, blog, ceramah, alat, dan tolok ukur. Dikelola oleh BenchFlow.

    865+18Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik