メインコンテンツへスキップ
buildradar
Sign in
トピック · evaluation

evaluation

evaluation がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

80 件のリポジトリ
  • RAG-FiT@IntelLabs

    ファインチューニングを使用してRAGタスク向けLLMを強化するためのフレームワーク。

    768-1直近 7 日のスター増減
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] LLM、VLM、動画生成モデルなどの大規模モデルを圧縮するための強力なツールキット

    747+1直近 7 日のスター増減
  • opik-openclaw@comet-ml

    🦞 エージェントのトレースをOpikにエクスポートするOpenClaw公式プラグイン。エージェントの動作、コスト、トークン、エラーなどを確認・監視できます。

    725+0直近 7 日のスター増減
  • iou-tracker@bochinski

    IOU Tracker の Python 実装

    702+0直近 7 日のスター増減
  • ranx@AmenRa

    ⚡️ランキング評価、比較、融合のための超高速なPythonライブラリ 🐍

    697+4直近 7 日のスター増減
  • long-form-factuality@google-deepmind

    大規模言語モデルにおける長文の事実性のベンチマーク。論文「Long-form factuality in large language models」のオリジナルコード。

    693+2直近 7 日のスター増減
  • ClawBench@TIGER-AI-Lab

    日常タスクにおけるブラウザ AI エージェントのオープンソースベンチマーク。

    657+40直近 7 日のスター増減
  • Awesome-LLM-Eval: LLMの評価に特化したツール、データセット/ベンチマーク、デモ、リーダーボード、論文、ドキュメント、モデルの厳選リスト。

    656-2直近 7 日のスター増減
  • autoprompt@ucinlp

    AutoPrompt: マスク言語モデルのための自動プロンプト構築

    641+1直近 7 日のスター増減
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: 大規模言語モデルにおける信頼性

    632+2直近 7 日のスター増減
  • 1つのC#ファイルで実装された、シンプルな数式および疑似C#式の評価器。小さなC#風スクリプトの実行も可能

    630+0直近 7 日のスター増減
  • 大規模言語モデルにおける機械アンラーニング(Machine Unlearning)のリポジトリ

    623+0直近 7 日のスター増減
  • tcexam@tecnickcom

    TCExamは、大学、学校、企業向けのCBA(コンピュータベースドテスト)システム(e試験、CBT)であり、教育者やトレーナーがアンケート、クイズ、小テスト、試験を作成、スケジュール、実施、レポート作成できるようにします。

    619+0直近 7 日のスター増減
  • simpleeval@danthedeckie

    Python向けのシンプルで安全、サンドボックス化された拡張可能な式評価エンジン

    611+0直近 7 日のスター増減
  • image-matching-toolbox@GrumpyZhou

    一対の画像から画像マッチングを実行するさまざまな手法を評価するためのツールボックスリポジトリ

    594-1直近 7 日のスター増減
  • MMMU@MMMU-Benchmark

    論文「MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI」の評価コードを含むリポジトリ

    593+1直近 7 日のスター増減
  • text2sql-data@jkkummerfeld

    質問と SQL クエリをペアにしたデータセットのコレクション

    588+1直近 7 日のスター増減
  • ParseBench@run-llama

    ParseBench - AI エージェントのためのドキュメント解析ベンチマーク

    563+6直近 7 日のスター増減
  • Meta Agents Research Environments は、動的かつ現実的なシナリオで AI エージェントを評価するために設計された包括的なプラットフォームです。静的なベンチマークとは異なり、このプラットフォームは、新しい情報が利用可能になるにつれてエージェントが戦略を適応させなければならない進化する環境を導入し、現実世界の課題を反映しています。

    550+3直近 7 日のスター増減
  • 社内文書におけるRAGのためのデータセットとベンチマーク。

    542+9直近 7 日のスター増減
← トピック一覧に戻る