Pular para o conteúdo principal
buildradar
Sign in
Tópico · dataset

dataset

Repositórios de código aberto acompanhados marcados com dataset, ordenados por estrelas.

Repositórios
147
Total de estrelas
828.882
Média de estrelas
5.639
Participação
0,04%

Tópicos que aparecem com frequência ao lado de dataset no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com dataset.

Nenhum repositório novo marcado com este tópico nos últimos 90 dias.

  • public-apis@public-apis

    Uma lista coletiva de APIs gratuitas

    472.776+4.663Variação de estrelas nos últimos 7 dias
  • label-studio@HumanSignal

    Label Studio é uma ferramenta de rotulagem e anotação de dados multitipo com formato de saída padronizado

    28.162+56Variação de estrelas nos últimos 7 dias
  • exercises-dataset@hasaneyldrm

    Dataset de fitness com 1.324 exercícios — GIFs animados, miniaturas 180×180, dados de grupos musculares e equipamentos, e instruções passo a passo em 6 idiomas. A camada de dados de exercícios por trás do aplicativo LogPress.

    21.087+523Variação de estrelas nos últimos 7 dias
  • faker@joke2k

    Faker é um pacote Python que gera dados falsos para você.

    19.383+9Variação de estrelas nos últimos 7 dias
  • cvat@cvat-ai

    Computer Vision Annotation Tool (CVAT) é uma plataforma líder para a criação de conjuntos de dados visuais de alta qualidade para visão computacional. Oferece produtos de código aberto, em nuvem e corporativos, além de serviços de rotulagem para anotação de imagem, vídeo e 3D com auxílio de IA, garantia de qualidade, colaboração em equipe, análise e APIs para desenvolvedores.

    16.618+51Variação de estrelas nos últimos 7 dias
  • LaTeX-OCR@lukas-blecher

    pix2tex: Usando um ViT para converter imagens de equações em código LaTeX.

    16.549+5Variação de estrelas nos últimos 7 dias
  • easy-dataset@ConardLi

    Uma ferramenta poderosa para criar datasets para fine-tuning de LLM, RAG e avaliação.

    14.854+43Variação de estrelas nos últimos 7 dias
  • doccano@doccano

    Ferramenta de anotação de código aberto para profissionais de aprendizado de máquina.

    10.760+7Variação de estrelas nos últimos 7 dias
  • techniques@satellite-image-deep-learning

    Técnicas de deep learning com imagens de satélite e aéreas

    10.240+6Variação de estrelas nos últimos 7 dias
  • Corpus de larga escala para processamento de linguagem natural em chinês

    9.910+1Variação de estrelas nos últimos 7 dias
  • Dados de compatibilidade de navegadores para tecnologias Web conforme exibidos no MDN.

    5.730+7Variação de estrelas nos últimos 7 dias
  • Awesome Pretrained Chinese NLP Models: uma coleção de modelos de pré-treinamento, grandes modelos, modelos multimodais e grandes modelos de linguagem em chinês de alta qualidade.

    5.582+0Variação de estrelas nos últimos 7 dias
  • Lista curada de conjuntos de dados e ferramentas para pós-treinamento.

    4.759+12Variação de estrelas nos últimos 7 dias
  • esProc@SPLWare

    esProc SPL é uma linguagem de programação baseada em JVM projetada para computação de dados estruturados, servindo tanto como ferramenta de análise de dados quanto como mecanismo de computação embarcado.

    4.684-2Variação de estrelas nos últimos 7 dias
  • transformer@hyunwoongko

    Transformer: Implementação em PyTorch de "Attention Is All You Need".

    4.648+10Variação de estrelas nos últimos 7 dias
  • datasets@tensorflow

    TFDS é uma coleção de conjuntos de dados prontos para uso com TensorFlow, Jax, etc.

    4.581+1Variação de estrelas nos últimos 7 dias
  • img2dataset@rom1504

    Converta facilmente grandes conjuntos de URLs de imagens em um dataset de imagens. Pode baixar, redimensionar e empacotar 100 milhões de URLs em 20 horas em uma única máquina.

    4.443+1Variação de estrelas nos últimos 7 dias
  • Corpus de nomes chineses. Gerador de nomes. Inclui nomes chineses, sobrenomes, prenomes, formas de tratamento, nomes japoneses e nomes traduzidos. Pode ser usado para segmentação de palavras em chinês e reconhecimento de entidades nomeadas.

    4.327+1Variação de estrelas nos últimos 7 dias
  • sql-translator@whoiskatrin

    SQL Translator é uma ferramenta para converter consultas em linguagem natural em código SQL usando inteligência artificial. Este projeto é 100% gratuito e de código aberto.

    4.321-2Variação de estrelas nos últimos 7 dias
  • CLUE@CLUEbenchmark

    Benchmark de Avaliação de Compreensão da Língua Chinesa (CLUE): datasets, baselines, modelos pré-treinados, corpus e placar de líderes

    4.279+0Variação de estrelas nos últimos 7 dias
  • O maior banco de dados e coleção de artigos sobre detecção de defeitos industriais, resumindo constantemente conjuntos de dados open source e pesquisas críticas na área.

    4.103+4Variação de estrelas nos últimos 7 dias
  • csghub@OpenCSGs

    CSGHub é uma nova plataforma de código aberto para gerenciar LLMs, desenvolvida pela equipe OpenCSG. Oferece soluções de código aberto e on-premise/SaaS, com recursos comparáveis ao Hugging Face. Obtenha controle total sobre o ciclo de vida de LLMs, datasets e agentes, com compatibilidade de SDK Python com o Hugging Face. Junte-se a nós! ⭐️

    4.101+3Variação de estrelas nos últimos 7 dias
  • Lista de artigos e conjuntos de dados para detecção industrial de anomalias/defeitos em imagens (em atualização).

    3.749+5Variação de estrelas nos últimos 7 dias
  • Um gerador de dados sintéticos para reconhecimento de texto.

    3.691+0Variação de estrelas nos últimos 7 dias
  • dataset@linhandev

    Um índice para conjuntos de dados de imagens médicas

    3.605+0Variação de estrelas nos últimos 7 dias
  • StringZilla@ashvardanian

    Strings até 100x mais rápidas para C, C++, CUDA, Python, Rust, Swift, JS e Go, aproveitando NEON, AVX2, AVX-512, SVE, GPGPU e SWAR para acelerar buscas, hashing, ordenação, distâncias de edição, sketches e operações de memória 🦖

    3.543+7Variação de estrelas nos últimos 7 dias
  • waymo-open-dataset@waymo-research

    Waymo Open Dataset

    3.400+8Variação de estrelas nos últimos 7 dias
  • Extraia dados de uma ampla gama de fontes da Internet para um DataFrame do pandas

    3.238+2Variação de estrelas nos últimos 7 dias
  • color-names@meodai

    Lista extensa de nomes de cores selecionados manualmente

    2.984+6Variação de estrelas nos últimos 7 dias
  • whylogs@whylabs

    Uma biblioteca de registro de dados de código aberto para modelos de machine learning e pipelines de dados. 📚 Fornece visibilidade sobre a qualidade dos dados e o desempenho do modelo ao longo do tempo. 🛡️ Suporta coleta de dados com preservação de privacidade, garantindo segurança e robustez. 📈

    2.831-1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos