R1-searcher: 強化学習による LLM の検索能力のインセンティブ化
このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。