dataset
Repositorios de código abierto monitorizados etiquetados con dataset, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a dataset en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con dataset.
- #1
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 594
- #1
Una lista colectiva de APIs gratuitas
★ 474.657+1881Variación de estrellas de los últimos 7 días - #2
Label Studio es una herramienta de etiquetado y anotación de datos multitiempo con formato de salida estandarizado
★ 28.191+29Variación de estrellas de los últimos 7 días - #3
Conjunto de datos de fitness de 1,324 ejercicios: GIFs animados, miniaturas de 180x180, datos de grupos musculares y equipos, e instrucciones paso a paso en 6 idiomas. La capa de datos de ejercicios detrás de la aplicación LogPress.
★ 21.288+201Variación de estrellas de los últimos 7 días - #4★ 19.386+3Variación de estrellas de los últimos 7 días
- #5
Computer Vision Annotation Tool (CVAT) es una plataforma líder para crear conjuntos de datos visuales de alta calidad para IA de visión. Ofrece productos de código abierto, en la nube y empresariales, así como servicios de etiquetado, para anotación de imágenes, video y 3D con etiquetado asistido por IA, control de calidad, colaboración en equipo, análisis y API para desarrolladores.
★ 16.636+18Variación de estrellas de los últimos 7 días - #6
pix2tex: uso de un ViT para convertir imágenes de ecuaciones en código LaTeX
★ 16.549+0Variación de estrellas de los últimos 7 días - #7
Una potente herramienta para crear conjuntos de datos para el ajuste fino de LLM, RAG y Eval
★ 14.874+20Variación de estrellas de los últimos 7 días - #8
Herramienta de anotación de código abierto para profesionales del aprendizaje automático.
★ 10.762+2Variación de estrellas de los últimos 7 días - #9
Técnicas de aprendizaje profundo con imágenes satelitales y aéreas
★ 10.241+1Variación de estrellas de los últimos 7 días - #10
Gran corpus en chino para PNL (Procesamiento de Lenguaje Natural)
★ 9912+2Variación de estrellas de los últimos 7 días - #11
Datos de compatibilidad de navegadores para tecnologías web mostrados en MDN
★ 5736+6Variación de estrellas de los últimos 7 días - #12
Awesome Pretrained Chinese NLP Models, colección de modelos de lenguaje preentrenados, modelos grandes y modelos multimodales en chino de alta calidad
★ 5584+2Variación de estrellas de los últimos 7 días - #13
Lista seleccionada de conjuntos de datos y herramientas para el post-entrenamiento.
★ 4760+1Variación de estrellas de los últimos 7 días - #14
esProc SPL es un lenguaje de programación basado en JVM diseñado para el cálculo de datos estructurados, que sirve tanto como herramienta de análisis de datos como motor de computación incrustado.
★ 4686+2Variación de estrellas de los últimos 7 días - #15
Transformer: Implementación en PyTorch de "Attention Is All You Need"
★ 4651+3Variación de estrellas de los últimos 7 días - #16
TFDS es una colección de conjuntos de datos listos para usar con TensorFlow, Jax, ...
★ 4583+2Variación de estrellas de los últimos 7 días - #17
Convierte fácilmente grandes conjuntos de URL de imágenes en un conjunto de datos de imágenes. Puede descargar, redimensionar y empaquetar 100M de URL en 20 horas en una sola máquina.
★ 4445+2Variación de estrellas de los últimos 7 días - #18
Corpus de nombres de personas en chino. Generador de nombres. Nombres, apellidos, nombres de pila, tratamientos, nombres japoneses, nombres traducidos, nombres en inglés. Útil para la segmentación de palabras en chino y el reconocimiento de entidades de nombres de personas.
★ 4328+1Variación de estrellas de los últimos 7 días - #19
SQL Translator es una herramienta para convertir consultas en lenguaje natural en código SQL utilizando inteligencia artificial. Este proyecto es 100% gratuito y de código abierto.
★ 4321+0Variación de estrellas de los últimos 7 días - #20
Evaluación comparativa de comprensión del idioma chino (Chinese Language Understanding Evaluation Benchmark): conjuntos de datos, líneas de base, modelos preentrenados, corpus y tabla de clasificación
★ 4278-1Variación de estrellas de los últimos 7 días - #21
📈 La base de datos y recopilación de artículos sobre detección de defectos industriales más grande del mundo hasta la fecha. Resumen constante de conjuntos de datos de código abierto y artículos críticos de gran importancia en el campo de la investigación de defectos superficiales.
★ 4104+1Variación de estrellas de los últimos 7 días - #22
CSGHub es una nueva plataforma de código abierto para gestionar LLMs, desarrollada por el equipo de OpenCSG. Ofrece soluciones tanto de código abierto como locales/SaaS, con características comparables a Hugging Face. Obtenga el control total sobre el ciclo de vida de los LLMs, conjuntos de datos y agentes, con compatibilidad de SDK de Python con Hugging Face. ¡Únase a nosotros! ⭐️
★ 4104+3Variación de estrellas de los últimos 7 días - #23
Lista de artículos y conjuntos de datos para detección de anomalías y defectos en imágenes industriales (en actualización).
★ 3756+7Variación de estrellas de los últimos 7 días - #24
Un generador de datos sintéticos para el reconocimiento de texto
★ 3693+2Variación de estrellas de los últimos 7 días - #25
Lista de conjuntos de datos de imágenes médicas "An Index for Medical Imaging Datasets"
★ 3606+1Variación de estrellas de los últimos 7 días - #26
Strings hasta 100 veces más rápidos para C, C++, CUDA, Python, Rust, Swift, JS y Go, aprovechando NEON, AVX2, AVX-512, SVE, GPGPU y SWAR para acelerar búsquedas, hashing, ordenamiento, distancias de edición, sketches y operaciones de memoria 🦖
★ 3549+6Variación de estrellas de los últimos 7 días - #27
Waymo Open Dataset
★ 3404+4Variación de estrellas de los últimos 7 días - #28
Extrae datos de una amplia gama de fuentes de Internet en un DataFrame de pandas.
★ 3240+2Variación de estrellas de los últimos 7 días - #29
Gran lista de nombres de colores seleccionados a mano 🌈
★ 2987+3Variación de estrellas de los últimos 7 días - #30
Una biblioteca de registro de datos de código abierto para modelos de machine learning y pipelines de datos. 📚 Proporciona visibilidad sobre la calidad de los datos y el rendimiento del modelo a lo largo del tiempo. 🛡️ Soporta la recopilación de datos preservando la privacidad, garantizando seguridad y robustez. 📈
★ 2831+0Variación de estrellas de los últimos 7 días