llm-evaluation
Repositorios de código abierto monitorizados etiquetados con llm-evaluation, ordenados por estrellas.
- #31
Un ejecutor de pruebas para habilidades de agentes de IA al estilo agentskills.io
★ 727+16Variación de estrellas de los últimos 7 días - #32
Benchmark de código abierto para agentes de IA en navegadores para tareas diarias.
★ 675+61Variación de estrellas de los últimos 7 días - #33
Awesome-LLM-Eval: una lista curada de herramientas, conjuntos de datos/benchmarks, demos, tablas de clasificación, artículos, documentación y modelos, enfocada principalmente en la evaluación de LLMs.
★ 656-2Variación de estrellas de los últimos 7 días - #34
Artículos destacados sobre el uso de LLM en ciencias sociales.
★ 648+1Variación de estrellas de los últimos 7 días - #35
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 623—Variación de estrellas de los últimos 7 días - #36
Conjunto de datos y benchmark para RAG en documentos internos de empresas.
★ 546+11Variación de estrellas de los últimos 7 días - #37
Evaluación basada en datos para aplicaciones impulsadas por LLM.
★ 517+1Variación de estrellas de los últimos 7 días