dataset
Repositórios de código aberto acompanhados marcados com dataset, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de dataset no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com dataset.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Uma lista coletiva de APIs gratuitas
★ 472.776+4.663Variação de estrelas nos últimos 7 dias - #2
Label Studio é uma ferramenta de rotulagem e anotação de dados multitipo com formato de saída padronizado
★ 28.162+56Variação de estrelas nos últimos 7 dias - #3
Dataset de fitness com 1.324 exercícios — GIFs animados, miniaturas 180×180, dados de grupos musculares e equipamentos, e instruções passo a passo em 6 idiomas. A camada de dados de exercícios por trás do aplicativo LogPress.
★ 21.087+523Variação de estrelas nos últimos 7 dias - #4★ 19.383+9Variação de estrelas nos últimos 7 dias
- #5
Computer Vision Annotation Tool (CVAT) é uma plataforma líder para a criação de conjuntos de dados visuais de alta qualidade para visão computacional. Oferece produtos de código aberto, em nuvem e corporativos, além de serviços de rotulagem para anotação de imagem, vídeo e 3D com auxílio de IA, garantia de qualidade, colaboração em equipe, análise e APIs para desenvolvedores.
★ 16.618+51Variação de estrelas nos últimos 7 dias - #6★ 16.549+5Variação de estrelas nos últimos 7 dias
- #7
Uma ferramenta poderosa para criar datasets para fine-tuning de LLM, RAG e avaliação.
★ 14.854+43Variação de estrelas nos últimos 7 dias - #8
Ferramenta de anotação de código aberto para profissionais de aprendizado de máquina.
★ 10.760+7Variação de estrelas nos últimos 7 dias - #9
Técnicas de deep learning com imagens de satélite e aéreas
★ 10.240+6Variação de estrelas nos últimos 7 dias - #10
Corpus de larga escala para processamento de linguagem natural em chinês
★ 9.910+1Variação de estrelas nos últimos 7 dias - #11
Dados de compatibilidade de navegadores para tecnologias Web conforme exibidos no MDN.
★ 5.730+7Variação de estrelas nos últimos 7 dias - #12
Awesome Pretrained Chinese NLP Models: uma coleção de modelos de pré-treinamento, grandes modelos, modelos multimodais e grandes modelos de linguagem em chinês de alta qualidade.
★ 5.582+0Variação de estrelas nos últimos 7 dias - #13
Lista curada de conjuntos de dados e ferramentas para pós-treinamento.
★ 4.759+12Variação de estrelas nos últimos 7 dias - #14
esProc SPL é uma linguagem de programação baseada em JVM projetada para computação de dados estruturados, servindo tanto como ferramenta de análise de dados quanto como mecanismo de computação embarcado.
★ 4.684-2Variação de estrelas nos últimos 7 dias - #15
Transformer: Implementação em PyTorch de "Attention Is All You Need".
★ 4.648+10Variação de estrelas nos últimos 7 dias - #16
TFDS é uma coleção de conjuntos de dados prontos para uso com TensorFlow, Jax, etc.
★ 4.581+1Variação de estrelas nos últimos 7 dias - #17
Converta facilmente grandes conjuntos de URLs de imagens em um dataset de imagens. Pode baixar, redimensionar e empacotar 100 milhões de URLs em 20 horas em uma única máquina.
★ 4.443+1Variação de estrelas nos últimos 7 dias - #18
Corpus de nomes chineses. Gerador de nomes. Inclui nomes chineses, sobrenomes, prenomes, formas de tratamento, nomes japoneses e nomes traduzidos. Pode ser usado para segmentação de palavras em chinês e reconhecimento de entidades nomeadas.
★ 4.327+1Variação de estrelas nos últimos 7 dias - #19
SQL Translator é uma ferramenta para converter consultas em linguagem natural em código SQL usando inteligência artificial. Este projeto é 100% gratuito e de código aberto.
★ 4.321-2Variação de estrelas nos últimos 7 dias - #20
Benchmark de Avaliação de Compreensão da Língua Chinesa (CLUE): datasets, baselines, modelos pré-treinados, corpus e placar de líderes
★ 4.279+0Variação de estrelas nos últimos 7 dias - #21
O maior banco de dados e coleção de artigos sobre detecção de defeitos industriais, resumindo constantemente conjuntos de dados open source e pesquisas críticas na área.
★ 4.103+4Variação de estrelas nos últimos 7 dias - #22
CSGHub é uma nova plataforma de código aberto para gerenciar LLMs, desenvolvida pela equipe OpenCSG. Oferece soluções de código aberto e on-premise/SaaS, com recursos comparáveis ao Hugging Face. Obtenha controle total sobre o ciclo de vida de LLMs, datasets e agentes, com compatibilidade de SDK Python com o Hugging Face. Junte-se a nós! ⭐️
★ 4.101+3Variação de estrelas nos últimos 7 dias - #23
Lista de artigos e conjuntos de dados para detecção industrial de anomalias/defeitos em imagens (em atualização).
★ 3.749+5Variação de estrelas nos últimos 7 dias - #24
Um gerador de dados sintéticos para reconhecimento de texto.
★ 3.691+0Variação de estrelas nos últimos 7 dias - #25★ 3.605+0Variação de estrelas nos últimos 7 dias
- #26
Strings até 100x mais rápidas para C, C++, CUDA, Python, Rust, Swift, JS e Go, aproveitando NEON, AVX2, AVX-512, SVE, GPGPU e SWAR para acelerar buscas, hashing, ordenação, distâncias de edição, sketches e operações de memória 🦖
★ 3.543+7Variação de estrelas nos últimos 7 dias - #27
Waymo Open Dataset
★ 3.400+8Variação de estrelas nos últimos 7 dias - #28
Extraia dados de uma ampla gama de fontes da Internet para um DataFrame do pandas
★ 3.238+2Variação de estrelas nos últimos 7 dias - #29
Lista extensa de nomes de cores selecionados manualmente
★ 2.984+6Variação de estrelas nos últimos 7 dias - #30
Uma biblioteca de registro de dados de código aberto para modelos de machine learning e pipelines de dados. 📚 Fornece visibilidade sobre a qualidade dos dados e o desempenho do modelo ao longo do tempo. 🛡️ Suporta coleta de dados com preservação de privacidade, garantindo segurança e robustez. 📈
★ 2.831-1Variação de estrelas nos últimos 7 dias