Saltar al contenido principal
buildradar
Sign in
Tema · dataset

dataset

Repositorios de código abierto monitorizados etiquetados con dataset, ordenados por estrellas.

148 repositorios
  • Contexto público de trading de BTC desde 2020.

    1216+2Variación de estrellas de los últimos 7 días
  • M2DGR@SJTU-ViSYS

    M2DGR: un conjunto de datos multimodal y multiescenario para robots terrestres (RA-L2021 y ICRA2022).

    1201+7Variación de estrellas de los últimos 7 días
  • chat-dataset-baseline@hikariming

    Conjunto de datos de diálogo en chino ajustado manualmente y código de ajuste fino para ChatGLM

    1191+0Variación de estrellas de los últimos 7 días
  • torchxrayvision@mlmed

    TorchXRayVision: una biblioteca de conjuntos de datos y modelos de radiografías de tórax. Incluye clasificadores, segmentación y autoencoders.

    1188+5Variación de estrellas de los últimos 7 días
  • covid-19@datasets

    Datos de series temporales sobre casos del nuevo coronavirus 2019

    1165+1Variación de estrellas de los últimos 7 días
  • domains@tb0hdan

    El conjunto de datos de dominios de Internet más grande del mundo

    1157+4Variación de estrellas de los últimos 7 días
  • Una lista de conjuntos de datos de Twitter y recursos relacionados.

    1125+1Variación de estrellas de los últimos 7 días
  • SoundMind@xid32

    Presentamos el conjunto de datos Audio Logical Reasoning (ALR), que consta de 6,446 muestras anotadas de texto-audio diseñadas específicamente para tareas de razonamiento complejo. Basándonos en este recurso, proponemos SoundMind, un algoritmo de aprendizaje por refuerzo (RL) basado en reglas diseñado para dotar a los modelos de lenguaje de audio (ALM) de capacidades de razonamiento bimodal profundo.

    1113+0Variación de estrellas de los últimos 7 días
  • game-datasets@leomaurodesenv

    Una lista curada de conjuntos de datos de juegos y herramientas para inteligencia artificial en videojuegos.

    1112+3Variación de estrellas de los últimos 7 días
  • insuranceqa-corpus-zh@chatopera

    :helicopter: Corpus de lenguaje para la industria de seguros, chatbot

    1064+1Variación de estrellas de los últimos 7 días
  • hagrid@hukenovs

    Conjunto de datos de imágenes para reconocimiento de gestos con las manos

    1057+5Variación de estrellas de los últimos 7 días
  • TransportationNetworks@bstabler

    Redes de transporte para investigación

    1050+0Variación de estrellas de los últimos 7 días
  • MMSA@thuiar

    MMSA es un framework unificado para el Análisis de Sentimientos Multimodal.

    1045+3Variación de estrellas de los últimos 7 días
  • name-dataset@philipperemy

    Biblioteca de Python para nombres.

    1019+2Variación de estrellas de los últimos 7 días
  • ThoughtSource@OpenBioLink

    Un recurso central y abierto para datos y herramientas relacionados con el razonamiento de cadena de pensamientos en modelos de lenguaje grandes. Desarrollado en el grupo de investigación de Samwald: https://samwald.info/

    1015+0Variación de estrellas de los últimos 7 días
  • Una lista pública y curada de recursos para biomecánica y análisis del movimiento humano: conjuntos de datos, herramientas de procesamiento, software de simulación, videos educativos, conferencias, etc.

    1010+3Variación de estrellas de los últimos 7 días
  • githut@madnight

    Estadísticas de lenguajes de GitHub

    1004+0Variación de estrellas de los últimos 7 días
  • Mobius@microsoft

    Enlace y extensiones de los lenguajes C# y F# para Apache Spark.

    948+0Variación de estrellas de los últimos 7 días
  • OmniAnomaly@NetManAIOps

    KDD 2019: Detección robusta de anomalías para series temporales multivariantes mediante redes neuronales recurrentes estocásticas

    948+2Variación de estrellas de los últimos 7 días
  • semantic-segmentation@sithu31296

    Modelos SOTA de segmentación semántica en PyTorch

    942-1Variación de estrellas de los últimos 7 días
  • tfrecord@vahidk

    Lector/escritor independiente de TFRecord con cargadores de datos de PyTorch.

    902+0Variación de estrellas de los últimos 7 días
  • API de SemanticKITTI para visualizar conjuntos de datos, procesar información y evaluar resultados.

    898+0Variación de estrellas de los últimos 7 días
  • deepfabric@nolabs-ai

    Generación de datos sintéticos de alta calidad, entrenamiento, medición y evaluación en un único pipeline

    885+2Variación de estrellas de los últimos 7 días
  • magpie@magpie-align

    [ICLR 2025] Síntesis de datos de alineación desde cero mediante prompts a LLMs alineados. ¡Su pipeline eficiente y de alta calidad para la generación de datos sintéticos!

    880+0Variación de estrellas de los últimos 7 días
  • OpenCUA@xlang-ai

    [NeurIPS 2025 Spotlight] OpenCUA: Fundamentos abiertos para agentes de uso informático

    833+6Variación de estrellas de los últimos 7 días
  • MINT-1T@mlfoundations

    MINT-1T: Un conjunto de datos multimodal intercalado de un billón de tokens.

    832+0Variación de estrellas de los últimos 7 días
  • PrimeKG@mims-harvard

    Grafo de conocimiento de medicina de precisión (PrimeKG)

    820+4Variación de estrellas de los últimos 7 días
  • opendata@NationalGalleryOfArt

    Programa de datos abiertos de la National Gallery of Art

    818+1Variación de estrellas de los últimos 7 días
  • pycococreator@waspinator

    Funciones auxiliares para crear datasets COCO.

    784+0Variación de estrellas de los últimos 7 días
  • Total-Text-Dataset@cs-chan

    Conjunto de datos Total Text. Consta de 1555 imágenes con más de 3 orientaciones de texto diferentes: horizontal, multiorientado y curvo, único en su tipo.

    772+0Variación de estrellas de los últimos 7 días
← Volver a temas