synthetic-data
Repositorios de código abierto monitorizados etiquetados con synthetic-data, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a synthetic-data en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con synthetic-data.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Código para Machine Learning for Trading, 3ª edición: desde la obtención de datos hasta la ejecución en vivo.
★ 20.762+43Variación de estrellas de los últimos 7 días - #2
¡Procesamiento de datos para y con modelos fundamentales! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
★ 6975+26Variación de estrellas de los últimos 7 días - #3
Construye, evalúa y optimiza sistemas de IA. Incluye evaluaciones, RAG, agentes, ajuste fino, generación de datos sintéticos, gestión de conjuntos de datos, MCP y más.
★ 5042+5Variación de estrellas de los últimos 7 días - #4
Mimesis es una librería de Python para generar datos falsos pero realistas en múltiples idiomas y configuraciones regionales.
★ 4839+0Variación de estrellas de los últimos 7 días - #5
Un pipeline procedural de Blender para la generación de imágenes de entrenamiento fotorrealistas
★ 3693+5Variación de estrellas de los últimos 7 días - #6★ 3551+0Variación de estrellas de los últimos 7 días
- #7
Distilabel es un framework para datos sintéticos y retroalimentación de IA para ingenieros que necesitan flujos rápidos, confiables y escalables basados en artículos de investigación verificados.
★ 3384+3Variación de estrellas de los últimos 7 días - #8★ 3323+2Variación de estrellas de los últimos 7 días
- #9★ 3322+5Variación de estrellas de los últimos 7 días
- #10
SDG es un framework especializado diseñado para generar datos tabulares estructurados de alta calidad.
★ 2436+1Variación de estrellas de los últimos 7 días - #11★ 2209+0Variación de estrellas de los últimos 7 días
- #12
🎨 NeMo Data Designer: Genera datos sintéticos de alta calidad desde cero o a partir de datos semilla.
★ 2197+7Variación de estrellas de los últimos 7 días - #13★ 1757+4Variación de estrellas de los últimos 7 días
- #14
Curación de datos sintéticos para post-entrenamiento y extracción de datos estructurados
★ 1722+2Variación de estrellas de los últimos 7 días - #15
Generadores de datos sintéticos para datos tabulares y de series temporales
★ 1654+0Variación de estrellas de los últimos 7 días - #16
Construye, enriquece y transforma conjuntos de datos utilizando modelos de IA sin necesidad de código.
★ 1641-1Variación de estrellas de los últimos 7 días - #17★ 1565+3Variación de estrellas de los últimos 7 días
- #18★ 1484+0Variación de estrellas de los últimos 7 días
- #19
Un marco para el diagnóstico integral y la optimización de agentes mediante interacciones sintéticas simuladas y realistas
★ 1257+0Variación de estrellas de los últimos 7 días - #20
DataDreamer: Escribe prompts, genera datos sintéticos, entrena y alinea modelos.
★ 1117+0Variación de estrellas de los últimos 7 días - #21
Synthadoc: motor de compilación de conocimiento LLM de código abierto que convierte documentos sin procesar en wikis estructurados y locales. Una alternativa transparente y legible por humanos al RAG tradicional, autogestionable y auto-mejorable sin herramientas externas.
★ 1116+2Variación de estrellas de los últimos 7 días - #22
Generación de datos sintéticos de alta calidad, entrenamiento, medición y evaluación en un único pipeline
★ 885+3Variación de estrellas de los últimos 7 días - #23
[ICLR 2025] Síntesis de datos de alineación desde cero mediante prompts a LLMs alineados. ¡Su pipeline eficiente y de alta calidad para la generación de datos sintéticos!
★ 881+1Variación de estrellas de los últimos 7 días - #24
Una biblioteca ligera para generar conjuntos de datos de ajuste de instrucciones sintéticas sin usar GPT.
★ 829+0Variación de estrellas de los últimos 7 días - #25
Verbalized Sampling, una estrategia de prompting sin entrenamiento para mitigar el colapso de modo en LLMs solicitando respuestas con probabilidades. Logra una mejora de diversidad de 2-3x manteniendo la calidad. Marco agnóstico al modelo con CLI/API para escritura creativa, generación de datos sintéticos y simulación de diálogos.
★ 803+1Variación de estrellas de los últimos 7 días - #26★ 798+5Variación de estrellas de los últimos 7 días
- #27★ 795+6Variación de estrellas de los últimos 7 días
- #28
Generación configurable de esquemas sintéticos y grafos de conocimiento al alcance de tu mano.
★ 715+1Variación de estrellas de los últimos 7 días - #29
Una biblioteca para generar y evaluar datos tabulares sintéticos para privacidad, equidad y aumento de datos.
★ 681+3Variación de estrellas de los últimos 7 días - #30★ 652+0Variación de estrellas de los últimos 7 días