Saltar al contenido principal
buildradar
Sign in
Tema · dataset

dataset

Repositorios de código abierto monitorizados etiquetados con dataset, ordenados por estrellas.

Repositorios
148
Estrellas totales
831.242
Estrellas de media
5617
Proporción
0,04%

Temas que aparecen con frecuencia junto a dataset en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con dataset.

  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594
  • public-apis@public-apis

    Una lista colectiva de APIs gratuitas

    474.657+1881Variación de estrellas de los últimos 7 días
  • label-studio@HumanSignal

    Label Studio es una herramienta de etiquetado y anotación de datos multitiempo con formato de salida estandarizado

    28.191+29Variación de estrellas de los últimos 7 días
  • exercises-dataset@hasaneyldrm

    Conjunto de datos de fitness de 1,324 ejercicios: GIFs animados, miniaturas de 180x180, datos de grupos musculares y equipos, e instrucciones paso a paso en 6 idiomas. La capa de datos de ejercicios detrás de la aplicación LogPress.

    21.288+201Variación de estrellas de los últimos 7 días
  • faker@joke2k

    Faker es un paquete de Python que genera datos falsos para ti.

    19.386+3Variación de estrellas de los últimos 7 días
  • cvat@cvat-ai

    Computer Vision Annotation Tool (CVAT) es una plataforma líder para crear conjuntos de datos visuales de alta calidad para IA de visión. Ofrece productos de código abierto, en la nube y empresariales, así como servicios de etiquetado, para anotación de imágenes, video y 3D con etiquetado asistido por IA, control de calidad, colaboración en equipo, análisis y API para desarrolladores.

    16.636+18Variación de estrellas de los últimos 7 días
  • LaTeX-OCR@lukas-blecher

    pix2tex: uso de un ViT para convertir imágenes de ecuaciones en código LaTeX

    16.549+0Variación de estrellas de los últimos 7 días
  • easy-dataset@ConardLi

    Una potente herramienta para crear conjuntos de datos para el ajuste fino de LLM, RAG y Eval

    14.874+20Variación de estrellas de los últimos 7 días
  • doccano@doccano

    Herramienta de anotación de código abierto para profesionales del aprendizaje automático.

    10.762+2Variación de estrellas de los últimos 7 días
  • techniques@satellite-image-deep-learning

    Técnicas de aprendizaje profundo con imágenes satelitales y aéreas

    10.241+1Variación de estrellas de los últimos 7 días
  • Gran corpus en chino para PNL (Procesamiento de Lenguaje Natural)

    9912+2Variación de estrellas de los últimos 7 días
  • Datos de compatibilidad de navegadores para tecnologías web mostrados en MDN

    5736+6Variación de estrellas de los últimos 7 días
  • Awesome Pretrained Chinese NLP Models, colección de modelos de lenguaje preentrenados, modelos grandes y modelos multimodales en chino de alta calidad

    5584+2Variación de estrellas de los últimos 7 días
  • Lista seleccionada de conjuntos de datos y herramientas para el post-entrenamiento.

    4760+1Variación de estrellas de los últimos 7 días
  • esProc@SPLWare

    esProc SPL es un lenguaje de programación basado en JVM diseñado para el cálculo de datos estructurados, que sirve tanto como herramienta de análisis de datos como motor de computación incrustado.

    4686+2Variación de estrellas de los últimos 7 días
  • transformer@hyunwoongko

    Transformer: Implementación en PyTorch de "Attention Is All You Need"

    4651+3Variación de estrellas de los últimos 7 días
  • datasets@tensorflow

    TFDS es una colección de conjuntos de datos listos para usar con TensorFlow, Jax, ...

    4583+2Variación de estrellas de los últimos 7 días
  • img2dataset@rom1504

    Convierte fácilmente grandes conjuntos de URL de imágenes en un conjunto de datos de imágenes. Puede descargar, redimensionar y empaquetar 100M de URL en 20 horas en una sola máquina.

    4445+2Variación de estrellas de los últimos 7 días
  • Corpus de nombres de personas en chino. Generador de nombres. Nombres, apellidos, nombres de pila, tratamientos, nombres japoneses, nombres traducidos, nombres en inglés. Útil para la segmentación de palabras en chino y el reconocimiento de entidades de nombres de personas.

    4328+1Variación de estrellas de los últimos 7 días
  • sql-translator@whoiskatrin

    SQL Translator es una herramienta para convertir consultas en lenguaje natural en código SQL utilizando inteligencia artificial. Este proyecto es 100% gratuito y de código abierto.

    4321+0Variación de estrellas de los últimos 7 días
  • CLUE@CLUEbenchmark

    Evaluación comparativa de comprensión del idioma chino (Chinese Language Understanding Evaluation Benchmark): conjuntos de datos, líneas de base, modelos preentrenados, corpus y tabla de clasificación

    4278-1Variación de estrellas de los últimos 7 días
  • 📈 La base de datos y recopilación de artículos sobre detección de defectos industriales más grande del mundo hasta la fecha. Resumen constante de conjuntos de datos de código abierto y artículos críticos de gran importancia en el campo de la investigación de defectos superficiales.

    4104+1Variación de estrellas de los últimos 7 días
  • csghub@OpenCSGs

    CSGHub es una nueva plataforma de código abierto para gestionar LLMs, desarrollada por el equipo de OpenCSG. Ofrece soluciones tanto de código abierto como locales/SaaS, con características comparables a Hugging Face. Obtenga el control total sobre el ciclo de vida de los LLMs, conjuntos de datos y agentes, con compatibilidad de SDK de Python con Hugging Face. ¡Únase a nosotros! ⭐️

    4104+3Variación de estrellas de los últimos 7 días
  • Lista de artículos y conjuntos de datos para detección de anomalías y defectos en imágenes industriales (en actualización).

    3756+7Variación de estrellas de los últimos 7 días
  • Un generador de datos sintéticos para el reconocimiento de texto

    3693+2Variación de estrellas de los últimos 7 días
  • dataset@linhandev

    Lista de conjuntos de datos de imágenes médicas "An Index for Medical Imaging Datasets"

    3606+1Variación de estrellas de los últimos 7 días
  • StringZilla@ashvardanian

    Strings hasta 100 veces más rápidos para C, C++, CUDA, Python, Rust, Swift, JS y Go, aprovechando NEON, AVX2, AVX-512, SVE, GPGPU y SWAR para acelerar búsquedas, hashing, ordenamiento, distancias de edición, sketches y operaciones de memoria 🦖

    3549+6Variación de estrellas de los últimos 7 días
  • waymo-open-dataset@waymo-research

    Waymo Open Dataset

    3404+4Variación de estrellas de los últimos 7 días
  • Extrae datos de una amplia gama de fuentes de Internet en un DataFrame de pandas.

    3240+2Variación de estrellas de los últimos 7 días
  • color-names@meodai

    Gran lista de nombres de colores seleccionados a mano 🌈

    2987+3Variación de estrellas de los últimos 7 días
  • whylogs@whylabs

    Una biblioteca de registro de datos de código abierto para modelos de machine learning y pipelines de datos. 📚 Proporciona visibilidad sobre la calidad de los datos y el rendimiento del modelo a lo largo del tiempo. 🛡️ Soporta la recopilación de datos preservando la privacidad, garantizando seguridad y robustez. 📈

    2831+0Variación de estrellas de los últimos 7 días
← Volver a temas