datasets
Repositórios de código aberto acompanhados marcados com datasets, ordenados por estrelas.
- #61★ 940+0Variação de estrelas nos últimos 7 dias
- #62
Rastreamento de conjuntos de dados médicos, com foco em imagens médicas
★ 926+2Variação de estrelas nos últimos 7 dias - #63
Backend que alimenta o visualizador de datasets nas páginas de datasets do Hugging Face através de uma API pública.
★ 900+1Variação de estrelas nos últimos 7 dias - #64
Croissant é um formato de alto nível para conjuntos de dados de aprendizado de máquina que reúne quatro camadas ricas.
★ 897+7Variação de estrelas nos últimos 7 dias - #65
🚀🚀🚀Uma coleção de projetos públicos incríveis sobre Modelos de Linguagem de Grande Escala (LLM), Modelos de Visão e Linguagem (VLM), Visão, Linguagem e Ação (VLA), Conteúdo Gerado por IA (AIGC), além de conjuntos de dados e aplicativos relacionados.
★ 815+1Variação de estrelas nos últimos 7 dias - #66
Links úteis de diversos conteúdos relacionados a IA, Visão Computacional e Robótica.
★ 784+0Variação de estrelas nos últimos 7 dias - #67★ 754+1Variação de estrelas nos últimos 7 dias
- #68
Uma coleção de conjuntos de dados de prompts e instruções incríveis para treinar ChatLLM, como o chatgpt.
★ 744+1Variação de estrelas nos últimos 7 dias - #69
Formato de arquivo novo e extensível para armazenamento de grandes conjuntos de dados colunares.
★ 733+3Variação de estrelas nos últimos 7 dias - #70
Uma lista curada de artigos, teses, conjuntos de dados e ferramentas relacionados à aplicação de Machine Learning na Engenharia de Software
★ 733+0Variação de estrelas nos últimos 7 dias - #71
Open Bandit Pipeline: uma biblioteca Python para algoritmos de bandits e avaliação off-policy
★ 708+1Variação de estrelas nos últimos 7 dias - #72
Framework de gerenciamento de datasets, uma biblioteca Python e ferramenta de CLI para construir, analisar e gerenciar datasets de Computer Vision
★ 689+2Variação de estrelas nos últimos 7 dias - #73
Logotipos compartilhados da Ultralytics, mídia, imagens de exemplo, pesos de modelos pré-treinados, artefatos de conjuntos de dados e ativos de lançamento.
★ 665+5Variação de estrelas nos últimos 7 dias - #74
O primeiro e maior benchmark de processamento de linguagem natural para a língua indonésia. Fornecemos múltiplas tarefas de downstream, modelos IndoBERT pré-treinados e código inicial! (AACL-IJCNLP 2020)
★ 655+1Variação de estrelas nos últimos 7 dias - #75
Uma coleção de datasets para segmentação / detecção de saliência. Pull requests são bem-vindos.
★ 640+0Variação de estrelas nos últimos 7 dias - #76
A ExerciseDB API é uma base de dados de exercícios físicos que permite aos usuários acessar dados de alta qualidade com mais de 11.000 exercícios. Esta API oferece informações detalhadas sobre cada exercício, incluindo partes do corpo alvo, equipamentos necessários, vídeos, GIFs, imagens para orientação visual e instruções passo a passo.
★ 628+20Variação de estrelas nos últimos 7 dias - #77
Este repositório fornece uma lista abrangente de conjuntos de dados de satélite de radar e ópticos selecionados para detecção, classificação, segmentação semântica e segmentação de instâncias de navios. Esses conjuntos de dados são ideais para aplicações em visão computacional, aprendizado de máquina, sensoriamento remoto e análise marítima.
★ 606+0Variação de estrelas nos últimos 7 dias - #78
Recursos de conjuntos de dados de histopatologia
★ 571+1Variação de estrelas nos últimos 7 dias - #79
Cleora AI é um modelo de código aberto de uso geral para aprendizado eficiente e escalável de embeddings de entidades estáveis e indutivas para dados relacionais heterogêneos. Criado pela equipe do Synerise.com.
★ 541+1Variação de estrelas nos últimos 7 dias - #80
Recursos incríveis sobre generalização de domínio, incluindo artigos, código, etc.
★ 539+1Variação de estrelas nos últimos 7 dias - #81
Artigos e conjuntos de dados sobre Instruction Tuning e Seguimento de Instruções. ✨✨✨
★ 511-1Variação de estrelas nos últimos 7 dias