OpenAI fought dirty on career-making math problem
OpenAIが数学問題で不公平な戦術を使ったと非難される。
AI 開発界隈が今まさに話題にしていることを、ソースから直接——新しい順に。
OpenAIが数学問題で不公平な戦術を使ったと非難される。
MetaのMuse AIエージェント機能の詳細。
関数引数は色の制約を課さない。
MetaプラットフォームのNudifyアプリ広告が未成年の実写真を使用。
ChatGPT Images 2.5が改善を伴って発表。
P3タイリングパターンを生成する方法を説明。
英国の空港でATC問題により便が欠航。
VisaとMastercardの役割と運用を説明…
ReCiteはエージェント推論で引用精度を向上。
手続きグラフが実行構造を進化させLLMを誘導。
wikiでのAIエージェント集団行動は…で説明。
ERPOは…でテスト時RLをコード生成に適用。
オンポリシー専門家修正が弱いモデルを改善。
ExecCriticはエージェントにテスト生成とコード修正を訓練。
標準色の復号可能性が…の概念情報を明らかに。
スケール不変の最適化安定性は…で支配。
MeClearはゲーム理論で…の有害記憶を除去。
SAEScientist-BenchはAIエージェントの自律SAE…を評価。
SPINEは継続的なマルチターンでのLLMの同調性を測定する。
アテンションシンクと大規模アクティベーションは…に由来する。
GoDeepは言語記述を3Dに引き上げて…
中期トレーニングのドメインカバレッジ最適値は存在するが、アライメント…
ActReviewは反論を用いてモデルを訓練し、実行可能な…
ToolLoopは閉ループでツール使用データを合成する…
臨床AI Doctorinaは医師や最先端…を上回る。
PlayTrainは効率的なRLのためにJavaScriptゲームを生成する…
Navier-Stokesミレニアム賞問題の議論。
Narrativesフレームワークは時変データを層としてモデル化する…
LLM行動のための訓練不要タスクベクトルを導入…
監査構築はLLMバイアス発見に…よりも影響する。
OUI-1は生成UIの最初のモデル。
推論表現は人間の評価に常に役立つとは限らない。
Show HN: LLMの注意を可視化するツール。
LLMの回答分布を追跡し推論を明らかにする。
司法省がICE捜査官の銃撃起訴を検察官に反して阻止。
AI支援コードの所有権と責任を探る。
連続拡散は制約付きで自己修正が必要。
ネットワークコンテキストでのマシン接続。
知識グラフ指標S3KGを提案しLLMを評価。
DeposonはLLM推論に監査可能な散乱層を追加。
物理情報深層学習がICU誤警報を削減。
Y Combinatorが早期アクセスネットワークを開始。
Transformerはデータの文脈内サンプラーとして機能。
Ganderは全知覚、リアルタイム対話などを統合。
最良の事前学習チェックポイントは完全なSFT後も最良とは限らない。
PlannerForgeはシナリオベースのADSテストにLLMエージェントを使用。
プライベートチャットからの研究盗用の疑惑。
SQLMorphはクエリを変異させ、詳細な指標を提供…
LGテレビはオフやアイドル時でもスパイすると報告。
グラフベースの代理モデリングのためのONECYLベンチマーク…
SkillAdamはAdamに触発された方法でエージェントスキルを最適化…
LLMは…で証拠よりもパラメトリック知識に依存。
AuKは音声生成と…のためのオープンソースモデルです。
ソース帰属の手がかりによりLLMが誤った答えに従う可能性。
C*言語はプログラミングと形式検証を統合。
2016年からの事実上のC標準を探る。
自己進化エージェントは高速状態と低速ポリシーを交互に…
警察はMetaメガネが秘密録画を可能にすると懸念。
BatchNormアーティファクトがアンラーニング評価を混乱させる…