Pular para o conteúdo principal
buildradar
Sign in
Tópico · dataset

dataset

Repositórios de código aberto acompanhados marcados com dataset, ordenados por estrelas.

148 repositórios
  • Contexto público de negociação de BTC desde 2020.

    1.216+1Variação de estrelas nos últimos 7 dias
  • M2DGR@SJTU-ViSYS

    M2DGR: um conjunto de dados multimodal e multiscenário para robôs terrestres (RA-L2021 & ICRA2022)

    1.201+5Variação de estrelas nos últimos 7 dias
  • chat-dataset-baseline@hikariming

    Conjunto de dados de diálogo em chinês ajustado manualmente e código de ajuste fino para chatglm.

    1.191+0Variação de estrelas nos últimos 7 dias
  • torchxrayvision@mlmed

    TorchXRayVision: Uma biblioteca de modelos e datasets de radiografias de tórax. Classificadores, segmentação e autoencoders.

    1.188+3Variação de estrelas nos últimos 7 dias
  • covid-19@datasets

    Dados de séries temporais de casos do novo coronavírus de 2019

    1.165+1Variação de estrelas nos últimos 7 dias
  • domains@tb0hdan

    O maior conjunto de dados de domínios da Internet do mundo.

    1.157+1Variação de estrelas nos últimos 7 dias
  • Uma lista de conjuntos de dados do Twitter e recursos relacionados.

    1.125+1Variação de estrelas nos últimos 7 dias
  • game-datasets@leomaurodesenv

    Uma lista curada de datasets de jogos e ferramentas para inteligência artificial em jogos.

    1.118+7Variação de estrelas nos últimos 7 dias
  • SoundMind@xid32

    Apresentamos o conjunto de dados Audio Logical Reasoning (ALR), composto por 6.446 amostras anotadas de texto-áudio projetadas especificamente para tarefas de raciocínio complexo. Com base neste recurso, propomos o SoundMind, um algoritmo de aprendizado por reforço (RL) baseado em regras, adaptado para dotar modelos de linguagem de áudio (ALMs) com habilidades profundas de raciocínio bimodal.

    1.113+0Variação de estrelas nos últimos 7 dias
  • insuranceqa-corpus-zh@chatopera

    Corpus de texto da indústria de seguros, chatbot

    1.064-1Variação de estrelas nos últimos 7 dias
  • hagrid@hukenovs

    Conjunto de dados de imagens para reconhecimento de gestos com as mãos

    1.059+8Variação de estrelas nos últimos 7 dias
  • TransportationNetworks@bstabler

    Redes de transporte para pesquisa

    1.051+1Variação de estrelas nos últimos 7 dias
  • MMSA@thuiar

    MMSA é um framework unificado para Análise de Sentimento Multimodal.

    1.046+3Variação de estrelas nos últimos 7 dias
  • name-dataset@philipperemy

    A biblioteca Python para nomes.

    1.018-1Variação de estrelas nos últimos 7 dias
  • ThoughtSource@OpenBioLink

    Um recurso central e aberto para dados e ferramentas relacionados ao raciocínio em cadeia de pensamento (chain-of-thought) em grandes modelos de linguagem. Desenvolvido pelo grupo de pesquisa Samwald: https://samwald.info/

    1.015+0Variação de estrelas nos últimos 7 dias
  • Uma lista pública e curada de recursos para biomecânica e análise de movimento humano: conjuntos de dados, ferramentas de processamento, software de simulação, vídeos educacionais, palestras, etc.

    1.010+2Variação de estrelas nos últimos 7 dias
  • githut@madnight

    Estatísticas de linguagens do GitHub

    1.004-1Variação de estrelas nos últimos 7 dias
  • Mobius@microsoft

    Bindings de linguagem e extensões em C# e F# para o Apache Spark

    948+0Variação de estrelas nos últimos 7 dias
  • OmniAnomaly@NetManAIOps

    KDD 2019: Detecção robusta de anomalias para séries temporais multivariadas através de redes neurais recorrentes estocásticas

    948+5Variação de estrelas nos últimos 7 dias
  • semantic-segmentation@sithu31296

    Modelos SOTA de segmentação semântica em PyTorch

    942-1Variação de estrelas nos últimos 7 dias
  • tfrecord@vahidk

    Leitor/gravador TFRecord autônomo com carregadores de dados do PyTorch

    902+0Variação de estrelas nos últimos 7 dias
  • API SemanticKITTI para visualização de conjuntos de dados, processamento de dados e avaliação de resultados.

    898+3Variação de estrelas nos últimos 7 dias
  • deepfabric@nolabs-ai

    Gere sintéticos de alta qualidade, treine, meça e avalie em um único pipeline

    885+3Variação de estrelas nos últimos 7 dias
  • magpie@magpie-align

    [ICLR 2025] Síntese de dados de alinhamento do zero, solicitando LLMs alinhados com nada. Seu pipeline de geração de dados sintéticos eficiente e de alta qualidade!

    881+2Variação de estrelas nos últimos 7 dias
  • OpenCUA@xlang-ai

    [Destaque NeurIPS 2025] OpenCUA: Fundações abertas para agentes de uso de computador

    833+4Variação de estrelas nos últimos 7 dias
  • MINT-1T@mlfoundations

    🍃 MINT-1T: Um conjunto de dados multimodal intercalado de um trilhão de tokens.

    832+0Variação de estrelas nos últimos 7 dias
  • PrimeKG@mims-harvard

    Grafo de Conhecimento de Medicina de Precisão (PrimeKG)

    823+5Variação de estrelas nos últimos 7 dias
  • opendata@NationalGalleryOfArt

    O Programa de Dados Abertos da National Gallery of Art.

    819+5Variação de estrelas nos últimos 7 dias
  • pycococreator@waspinator

    Funções auxiliares para criar datasets COCO

    783-1Variação de estrelas nos últimos 7 dias
  • Total-Text-Dataset@cs-chan

    Total Text Dataset. Consiste em 1555 imagens com mais de 3 orientações de texto diferentes: horizontal, multi-orientado e curvo, único em seu tipo.

    771-1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos