dataset
Repositórios de código aberto acompanhados marcados com dataset, ordenados por estrelas.
- #61
Contexto público de negociação de BTC desde 2020.
★ 1.216+1Variação de estrelas nos últimos 7 dias - #62
M2DGR: um conjunto de dados multimodal e multiscenário para robôs terrestres (RA-L2021 & ICRA2022)
★ 1.201+5Variação de estrelas nos últimos 7 dias - #63
Conjunto de dados de diálogo em chinês ajustado manualmente e código de ajuste fino para chatglm.
★ 1.191+0Variação de estrelas nos últimos 7 dias - #64
TorchXRayVision: Uma biblioteca de modelos e datasets de radiografias de tórax. Classificadores, segmentação e autoencoders.
★ 1.188+3Variação de estrelas nos últimos 7 dias - #65★ 1.165+1Variação de estrelas nos últimos 7 dias
- #66★ 1.157+1Variação de estrelas nos últimos 7 dias
- #67
Uma lista de conjuntos de dados do Twitter e recursos relacionados.
★ 1.125+1Variação de estrelas nos últimos 7 dias - #68
Uma lista curada de datasets de jogos e ferramentas para inteligência artificial em jogos.
★ 1.118+7Variação de estrelas nos últimos 7 dias - #69
Apresentamos o conjunto de dados Audio Logical Reasoning (ALR), composto por 6.446 amostras anotadas de texto-áudio projetadas especificamente para tarefas de raciocínio complexo. Com base neste recurso, propomos o SoundMind, um algoritmo de aprendizado por reforço (RL) baseado em regras, adaptado para dotar modelos de linguagem de áudio (ALMs) com habilidades profundas de raciocínio bimodal.
★ 1.113+0Variação de estrelas nos últimos 7 dias - #70
Corpus de texto da indústria de seguros, chatbot
★ 1.064-1Variação de estrelas nos últimos 7 dias - #71★ 1.059+8Variação de estrelas nos últimos 7 dias
- #72
Redes de transporte para pesquisa
★ 1.051+1Variação de estrelas nos últimos 7 dias - #73★ 1.046+3Variação de estrelas nos últimos 7 dias
- #74
A biblioteca Python para nomes.
★ 1.018-1Variação de estrelas nos últimos 7 dias - #75
Um recurso central e aberto para dados e ferramentas relacionados ao raciocínio em cadeia de pensamento (chain-of-thought) em grandes modelos de linguagem. Desenvolvido pelo grupo de pesquisa Samwald: https://samwald.info/
★ 1.015+0Variação de estrelas nos últimos 7 dias - #76
Uma lista pública e curada de recursos para biomecânica e análise de movimento humano: conjuntos de dados, ferramentas de processamento, software de simulação, vídeos educacionais, palestras, etc.
★ 1.010+2Variação de estrelas nos últimos 7 dias - #77★ 1.004-1Variação de estrelas nos últimos 7 dias
- #78★ 948+0Variação de estrelas nos últimos 7 dias
- #79
KDD 2019: Detecção robusta de anomalias para séries temporais multivariadas através de redes neurais recorrentes estocásticas
★ 948+5Variação de estrelas nos últimos 7 dias - #80
Modelos SOTA de segmentação semântica em PyTorch
★ 942-1Variação de estrelas nos últimos 7 dias - #81★ 902+0Variação de estrelas nos últimos 7 dias
- #82
API SemanticKITTI para visualização de conjuntos de dados, processamento de dados e avaliação de resultados.
★ 898+3Variação de estrelas nos últimos 7 dias - #83
Gere sintéticos de alta qualidade, treine, meça e avalie em um único pipeline
★ 885+3Variação de estrelas nos últimos 7 dias - #84
[ICLR 2025] Síntese de dados de alinhamento do zero, solicitando LLMs alinhados com nada. Seu pipeline de geração de dados sintéticos eficiente e de alta qualidade!
★ 881+2Variação de estrelas nos últimos 7 dias - #85
[Destaque NeurIPS 2025] OpenCUA: Fundações abertas para agentes de uso de computador
★ 833+4Variação de estrelas nos últimos 7 dias - #86
🍃 MINT-1T: Um conjunto de dados multimodal intercalado de um trilhão de tokens.
★ 832+0Variação de estrelas nos últimos 7 dias - #87★ 823+5Variação de estrelas nos últimos 7 dias
- #88★ 819+5Variação de estrelas nos últimos 7 dias
- #89
Funções auxiliares para criar datasets COCO
★ 783-1Variação de estrelas nos últimos 7 dias - #90
Total Text Dataset. Consiste em 1555 imagens com mais de 3 orientações de texto diferentes: horizontal, multi-orientado e curvo, único em seu tipo.
★ 771-1Variação de estrelas nos últimos 7 dias