dataset
Repositorios de código abierto monitorizados etiquetados con dataset, ordenados por estrellas.
- #31
Conjunto de datos mantenido por la comunidad con más de 700 sitios web para buscar cuentas por nombre de usuario; impulsa herramientas de OSINT y huella digital.
★ 2820+13Variación de estrellas de los últimos 7 días - #32
🎁 Más de 7,400,000 imágenes de Unsplash disponibles para investigación y machine learning
★ 2783+3Variación de estrellas de los últimos 7 días - #33
[ECCV 2018] CCPD: un conjunto de datos diverso y bien anotado para la detección y el reconocimiento de matrículas
★ 2651+4Variación de estrellas de los últimos 7 días - #34★ 2647+4Variación de estrellas de los últimos 7 días
- #35
Recursos públicos de PNL médica en chino: conjuntos de términos, corpus, vectores de palabras, modelos preentrenados, gráficos de conocimiento, reconocimiento de entidades nombradas, QA, extracción de información, modelos, artículos, etc.
★ 2627+2Variación de estrellas de los últimos 7 días - #36
180 degradados gratuitos de CSS3, Figma, Sketch y PSD, además de un conjunto de datos JSON para herramientas de diseño, generadores y agentes de IA.
★ 2473+0Variación de estrellas de los últimos 7 días - #37
Listas de países ISO 3166-1 combinadas con sus códigos regionales del esquema geográfico de la ONU en conjuntos de datos JSON, XML y CSV listos para usar
★ 2470-1Variación de estrellas de los últimos 7 días - #38
Objectron es un conjunto de datos de clips de video cortos centrados en objetos. Además, los videos contienen metadatos de sesiones de AR, incluidas poses de cámara, nubes de puntos dispersas y planos. En cada video, la cámara se mueve alrededor y por encima del objeto, capturándolo desde diferentes perspectivas. Cada objeto está anotado con una caja delimitadora 3D. La caja delimitadora 3D describe la posición, orientación y dimensión del objeto
★ 2349+0Variación de estrellas de los últimos 7 días - #39
Una recopilación completa y actualizada de conjuntos de datos, herramientas, métodos, artículos de revisión y competiciones para la detección de cambios por teledetección.
★ 2315+3Variación de estrellas de los últimos 7 días - #40
Un benchmark heterogéneo para recuperación de información. Fácil de usar, evalúa tus modelos en más de 15 conjuntos de datos de IR diversos.
★ 2283+5Variación de estrellas de los últimos 7 días - #41
🔊 Una lista completa de conjuntos de datos de código abierto para voz y computación de sonido (más de 95 conjuntos de datos).
★ 2223+1Variación de estrellas de los últimos 7 días - #42
Un conjunto de datos de mapas globales de dominio público disponible en tres escalas, con datos vectoriales y ráster estrechamente integrados.
★ 2192+2Variación de estrellas de los últimos 7 días - #43
Datos de clusters recopilados de clusters de producción en Alibaba para la investigación de la gestión de clusters.
★ 2176+12Variación de estrellas de los últimos 7 días - #44
Colabora y etiqueta cualquier tipo de datos, imágenes, texto o documentos en una interfaz web o aplicación de escritorio fácil de usar.
★ 2071-1Variación de estrellas de los últimos 7 días - #45
fastdup es una herramienta potente y gratuita diseñada para generar rápidamente información valiosa a partir de conjuntos de datos de imágenes y videos. Ayuda a mejorar la calidad tanto de las imágenes como de las etiquetas, al tiempo que reduce significativamente los costos de operación de datos, todo con una escalabilidad inigualable.
★ 1906-1Variación de estrellas de los últimos 7 días - #46
Una lista curada de artículos y recursos sobre detección de fraudes, anomalías y valores atípicos basados en grafos y Transformers.
★ 1889+0Variación de estrellas de los últimos 7 días - #47
Una lista seleccionada de conjuntos de datos de radar, detección, seguimiento y fusión
★ 1880+1Variación de estrellas de los últimos 7 días - #48★ 1865+3Variación de estrellas de los últimos 7 días
- #49
Lista de herramientas, artículos y código relacionados con la detección de Deepfakes
★ 1823+4Variación de estrellas de los últimos 7 días - #50
Conjuntos de datos SQL y GIS completos para unidades administrativas de Vietnam, incluyendo provincias, distritos, comunas y límites geoespaciales.
★ 1784+4Variación de estrellas de los últimos 7 días - #51
Modelo de lenguaje grande (LLM) para salud mental, incluyendo pre y post-entrenamiento, conjuntos de datos, evaluación, despliegue y RAG, con modelos de las series InternLM, Qwen, Baichuan, DeepSeek, Mixtral, LLama y GLM.
★ 1781+1Variación de estrellas de los últimos 7 días - #52★ 1757+7Variación de estrellas de los últimos 7 días
- #53★ 1672+4Variación de estrellas de los últimos 7 días
- #54
¿Qué hay en tus datos? Extrae esquemas, estadísticas y entidades de conjuntos de datos.
★ 1579+0Variación de estrellas de los últimos 7 días - #55
Una biblioteca de transmisión de datos para el entrenamiento eficiente de redes neuronales
★ 1554+2Variación de estrellas de los últimos 7 días - #56
HumanML3D: Un conjunto de datos grande y diverso de movimiento humano en 3D y lenguaje.
★ 1524+2Variación de estrellas de los últimos 7 días - #57
Un corpus de diálogo multilingüe
★ 1417+0Variación de estrellas de los últimos 7 días - #58
[pip install medmnist] 18 conjuntos de datos estandarizados para la clasificación de imágenes biomédicas 2D y 3D
★ 1399+0Variación de estrellas de los últimos 7 días - #59
Corpus de nombres de empresas e instituciones. Incluye abreviaturas, marcas y nombres corporativos. Útil para segmentación de texto en chino y reconocimiento de entidades.
★ 1296+0Variación de estrellas de los últimos 7 días - #60
Repositorio de fuentes de datos públicas para sistemas de recomendación (RS).
★ 1255-3Variación de estrellas de los últimos 7 días