To request an evaluation, submit a publicly available Hugging Face retrieval model through our evalu...
Perplexity推出Q2D-Web检索基准,包含19亿文档和7万查询,提供模型评估请求表单及技术报告。
入选理由:Q2D-Web基准包含19亿文档和7万个生产衍生查询
论文
别名:arxiv.org
技术报告发布平台
已跟踪 11 条高相关材料
最近变化
2026-09-09 · Q2D-Web基准包含19亿文档和7万个生产衍生查询
为什么值得关注
arXiv 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
To request an evaluation, submit a publicly available Hugging Face retrieval model through our evalu...
Perplexity(@perplexity_ai) · 8.5 分
Perplexity推出Q2D-Web检索基准,包含19亿文档和7万查询,提供模型评估请求表单及技术报告。
Shieldstral is available under Apache 2.0. Try it: https://t.co/Hqlo3o7t6M
Mistral AI(@MistralAI) · 8.5 分
Mistral AI发布Shieldstral,一个3B参数的开放权重内容安全模型,支持多模态审核并可在设备部署。
一个随机数就能识别AI模型身份:行为指纹技术可检测API中转站偷换模型
AI HOT 精选 · 8.5 分
行为指纹技术通过让AI模型生成随机数序列,可识别其身份并检测API中转站偷换模型,错误率约10.6%。
已收录 11 条与 arXiv 相关的内容,按评分排序。
Perplexity推出Q2D-Web检索基准,包含19亿文档和7万查询,提供模型评估请求表单及技术报告。
入选理由:Q2D-Web基准包含19亿文档和7万个生产衍生查询
Mistral AI发布Shieldstral,一个3B参数的开放权重内容安全模型,支持多模态审核并可在设备部署。
入选理由:Shieldstral是3B参数模型,基于Apache 2.0许可证开放
行为指纹技术通过让AI模型生成随机数序列,可识别其身份并检测API中转站偷换模型,错误率约10.6%。
入选理由:生成1-100随机数可创建模型行为指纹,GPT-4o偏好42和37
DiScoFormer通过单次前向传播同时估计密度和分数,解决高维数据分布建模的准确性和泛化性矛盾。
入选理由:DiScoFormer利用交叉注意力机制实现任意点的密度/分数估计
腾讯混元联合多所高校推出MMAE,首个全面评估AI音频编辑能力的基准,揭示当前模型在精确编辑音频任务上的不足。
入选理由:MMAE包含2000个高质量真实场景音频样本,覆盖语音、音乐及混合类型。
LlamaIndex 推出 ParseBench,首个面向 AI 的文档解析基准,强调文档理解是实现 AGI 的关键挑战。
入选理由:ParseBench 是首个面向 AI 的文档解析基准,包含 167K+ 测试规则。
NVIDIA 发布了一个 26 亿参数的开源世界模型,可在单个 GPU 上运行,适用于多种应用场景。
入选理由:NVIDIA 开源了 26 亿参数的世界模型,可在单个 GPU(如 RTX 5090 或 H100)上运行。
arXiv对伪造参考文献实施1年禁令,要求作者对论文内容负全责。
入选理由:arXiv将对伪造参考文献的作者实施1年禁令
ExtractBench基准测试揭示了文档提取系统在处理真实世界文档时的感知盲区,包含扫描件、手写件等挑战性数据集。
入选理由:Codex在扫描件表现优异但旋转文档处理不佳
文章提及世界模型发展迅速,但内容过于简略,缺乏技术细节和深度分析。
入选理由:世界模型(World Models)正在快速发展,未来可能在家庭环境中部署类似Genie 3的系统。
文章仅罗列五条简短科技新闻,无机制分析、数据支撑或工程洞察,属于信息聚合类推文,缺乏深度与实用价值。
入选理由:文章仅罗列五条简短科技新闻,无机制分析、数据支撑或工程洞察,属于信息聚合类推文,缺乏深度与实用价值