IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications
660個實例的基準測試研究規格是否…
radar 從 arXiv cs.AI / cs.CL / cs.LG 收集到的所有情報,最新的在最前面。
660個實例的基準測試研究規格是否…
正規化流產生近樞軸統計量儘管…
語意介面讓VLM代理零樣本控制機器人…
IQP電路特徵提升信用資料的邏輯迴歸F1…
分割模型間的跨模型一致性標記…
協議以服務路徑而非…評估企業AI
Semigroup-JEPA提升零樣本物理泛化…
基準測試評估GUI代理跨裝置動態…
SFT資料混合實現60種語言內推理…
免訓練卷積記憶體實現平行處理
層選擇性遺忘移除目標知識
HuBERT 與 wav2vec 2.0 編碼詞彙身分
深度 RL 訓練無人機導航與監控
LLM 知識圖譜篩查急診再訪
本體驅動記憶體生命週期政策降低 LLM 成本
VLM 透過指令使 Bluesky 審核 F1 近三倍
EXCODER 為 Java 程式碼加裝例外處理
MOONWALK 對齊動畫中的意圖、證據與行動
PACE 降低檢索增強對話的感知延遲
OmniMed-FL 建立多模態聯邦學習基準
發布後保留測試仍偏好熟悉該領域的模型
影片與音訊推論效率方法綜述
建模 AI 供應商外洩如何透過供應鏈擴散損失
VIP-Router 為每個樣本選擇視覺 token 剪枝策略
符號解析器加求解器讓純 LLM 做幾何
OnPoKD 為 VLM 依樣本調整蒸餾目標
TRACE 用模擬干預訓練診斷代理
RiLM 以測地距離解碼 token,捨棄該方法
訓練後的稀疏自編碼器趨於瀰散狀態
GANDR 依引用來源審查每項法律主張
將軟先驗衰減至零可保留已學檢索
KVShareArena 對跨情境的 KV-cache 重用進行基準測試
Maverick 將矩陣向量乘積委派以保護隱私
RD-Forget 將儲存的代理記憶與查詢時使用分離
DiSCo 衡量 LLM 中的預設文化偏好偏誤
A-JIT 讓應用程式在執行時合成並演化程式碼
LiteRAG 以演算法降低圖檢索成本
答案路徑存在與接地指令驅動 KG QA
新基準以開放式 LLM 任務評估 LLM
框架學習置換不變的階層特徵
FGPO 精確評分所有工具子集,勝過 GRPO
JAET 在政治文本中聯合標註論元與實體
EvidenceNet 驗證協同 AI agent 是否…
對比示範建模對齊多模態…
CoGe-GCD 將廣義類別發現重新定義為…
DoRA 適配器將個別文本語料整合為…
CompassOPD 轉移同族內的可能性偏移以…
YallaMorph 基準測試阿拉伯語構詞生成…
核心管理的共享記憶體改善多代理…
預防性引導透過主動適應運作;…
SmartWeatherAgent 融合 ML 與 LLM 於高原旅遊…
框架形式化情境操作與評估以…
自動化框架持續從…描繪溝角
LLM 誤判正確程式碼有錯,導致無止盡…
ProbPlug 為 LLM 二元分類估計信心…
以資料為中心的流程改善金融推理…
分類法評估二十種推論時 AI 方法可行性…
回顧評估 82 種從頭分子生成方法…
滾動基準測試 LLM 研究關注度預測…
基於參考的隱狀態法偵測偏誤漂移…