如何从 PDF 构建金融知识图谱?
LandingAI 黑客松项目 ArthaNethra 展示了从 PDF 到可查询、可溯源、可推理的知识图谱的完整流程:上传 → ADE 提取 → 归一化 → 双库索引 → 风险检测。
入选理由:使用 LandingAI ADE 实现结构化提取,>15MB 文档走异步 + 指数退避机制
公司
别名:weaviate_io
提供向量数据库解决方案的AI公司
已跟踪 30 条高相关材料
最近变化
2026-09-01 · 传统RAG处理PDF图表时,30%的查询会因图表信息缺失导致错误
为什么值得关注
Weaviate 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
如何从 PDF 构建金融知识图谱? LandingAI 黑客松项目「ArthaNethra」,展示了从 PDF 到可查询、可溯源、可推理的知识图谱的完整流程: 上传 → ADE 提取 → 归一化 →...
meng shao(@shao__meng) · 9.2 分
LandingAI 黑客松项目 ArthaNethra 展示了从 PDF 构建金融知识图谱的端到端流程:上传 → ADE 提取 → 归一化 → 双库索引 → 风险检测,支持 10 类实体、26 种关系,结合 Weaviate(语义检索)与 Neo4j(图遍历),实现可查询、可溯...
𝗬𝗼𝘂𝗿 𝗥𝗔𝗚 𝘀𝘆𝘀𝘁𝗲𝗺 𝗽𝗿𝗼𝗱𝘂𝗰𝗲𝘀 "𝗵𝗶𝗴𝗵𝗲𝗿-𝗳𝗹𝘂𝗲𝗻𝗰𝘆 ...
Weaviate • vector database(@weaviate_io) · 8.7 分
研究发现,RAG系统中检索质量差是导致高流畅性幻觉(更自信但更错误)的主因,模型升级无法弥补检索缺陷。
How to extract meaning from charts and tables in PDFs
Weaviate Blog · 8.5 分
Weaviate提出Late Interaction RAG方法,通过多向量模型直接解析PDF图表,解决传统RAG无法提取图表信息的缺陷。
已收录 30 条与 Weaviate 相关的内容,按评分排序。
LandingAI 黑客松项目 ArthaNethra 展示了从 PDF 到可查询、可溯源、可推理的知识图谱的完整流程:上传 → ADE 提取 → 归一化 → 双库索引 → 风险检测。
入选理由:使用 LandingAI ADE 实现结构化提取,>15MB 文档走异步 + 指数退避机制
研究发现,RAG系统中检索质量差是导致高流畅性幻觉(更自信但更错误)的主因,模型升级无法弥补检索缺陷。
入选理由:检索质量差是RAG输出退化的最主要预测指标,模型能力增强反而加剧幻觉可信度。
Weaviate 1.39发布Boost API和MMR多样性选择,4-bit量化预览提升搜索性能,开源社区功能持续优化。
入选理由:Boost API实现查询时动态重排序,支持过滤/数值衰减等条件组合
Weaviate提出Late Interaction RAG方法,通过多向量模型直接解析PDF图表,解决传统RAG无法提取图表信息的缺陷。
入选理由:传统RAG处理PDF图表时,30%的查询会因图表信息缺失导致错误
Weaviate的Query Agent现在在搜索前自动探索数据,提升过滤和搜索效率,无需手动配置。
入选理由:Query Agent自动识别过滤值和数值属性统计信息(如平均值、中位数)
可靠代理式RAG需控制信息到达模型的方式,而非单纯优化提示词。Weaviate提出上下文工程的五大系统框架。
入选理由:查询增强需重构用户输入以提升检索精度
RAG技术因文本转换瓶颈限制多模态能力,Weaviate联合Gemini Embedding 2实现原生多模态向量嵌入。
入选理由:多模态RAG跳过文本转换步骤可保留原始媒体语义
Weaviate 1.39发布,新增Boost API、MMR多样性选择等特性,优化搜索与存储效率。
入选理由:Boost API允许在查询时动态调整搜索结果排序,无需丢弃数据。
Weaviate的Search Mode通过调整effort参数显著提升检索效果,ultrahigh级别在BRIGHT Biology基准上将nDCG@10从13.0提升至57.5。
入选理由:Search Mode的ultrahigh effort在BRIGHT Biology基准上提升nDCG@10至57.5
创意工作流程在文件夹结构、标签系统和关键词搜索三个层面存在根本性失效,导致项目规模扩大后检索效率骤降。
入选理由:文件夹结构在跨团队协作时产生30%以上的元数据不一致
Weaviate推出的Query Agent新增Suggest Queries模式,通过自动生成建议查询提升AI聊天界面的用户体验。
入选理由:Suggest Queries模式支持两种场景:对话启动时生成引导问题,对话中生成自然追问
Weaviate数据库新增MCP协议支持,允许直接通过/v1/mcp端点进行操作,无需独立服务。提供四个工具实现配置查询、租户管理、混合搜索和对象操作。
入选理由:Weaviate通过/v1/mcp端点原生支持MCP协议,兼容Claude Code/Cursor/VS Code
Weaviate推出Search Mode的effort参数,允许用户通过调整计算资源提升搜索质量,但需权衡性能与成本。
入选理由:Search Mode提供medium/high/ultrahigh三级effort参数控制计算资源投入
Weaviate推出可配置召回率与精确率权衡的Query Agent搜索模式,工程师可按需选择多查询召回或单查询精确策略。
入选理由:recall模式通过多查询提升相关性结果数量,适合优先考虑覆盖率的场景。
AI通过优化检索系统减少创意工作中的摩擦,而非取代创造力。文章揭示了创意行业普遍存在的文件检索困境,并提出AI驱动的解决方案。
入选理由:创意行业70%时间消耗在文件检索与版本管理而非创作本身
本文展示如何使用Weaviate和Gemini模型直接处理音频,无需转录文本。通过音频分块、多模态嵌入和向量检索技术,实现音频内容的高效存储与检索。
入选理由:使用Gemini Embedding 2生成音频多模态嵌入向量
Weaviate推出查询性能分析功能,可精准定位慢查询的瓶颈。通过per-query profiling直接返回各阶段耗时,无需重启或等待查询变慢。
入选理由:启用query_profile标志可获取每个查询的详细性能分析
Weaviate 的 Engram 系统通过异步流水线实现多代理记忆管理,支持无阻塞学习与去重。
入选理由:Engram 通过提取、转换、提交三步骤处理多代理记忆,避免重复和阻塞。
增加上下文窗口无法解决agentic RAG管道问题,核心在于上下文工程。长上下文会引入矛盾信息,需通过五层系统设计控制信息流。
入选理由:RAG管道需优化查询增强、检索、记忆、工具和代理五层系统
Engram现已正式发布,提供结构化记忆管理,解决代理系统的三大核心问题。
入选理由:长上下文退化导致模型延迟和质量下降,Engram通过异步管道解决此问题。
Weaviate Cloud 现在提供完整产品套件的免费层级,无需信用卡且无时间限制,包含数据库、Query Agent 和 Engram。
入选理由:Weaviate Cloud 免费层级无信用卡和时间限制,可长期使用。
Weaviate官方博客分享了大规模数据导入和向量化实践,重点介绍服务器端批处理、错误处理及媒体处理策略,解决速率限制和批量失败问题。
入选理由:使用Weaviate服务器端批处理可动态调整批次大小,避免速率限制
Weaviate 1.38版本发布,HFresh向量索引和MCP服务器达一般可用性,提升百亿级数据处理和LLM集成能力。
入选理由:HFresh向量索引支持百亿级数据处理,内存占用低,适合流式工作负载。
Weaviate 推出查询分析功能,可实时定位慢查询耗时环节,解决传统慢查询日志的四大痛点。
入选理由:查询分析功能无需重启节点即可实时分析慢查询
Weaviate的托管版本现已在DigitalOcean上公开预览,提供基础设施管理服务。
入选理由:DigitalOcean托管Weaviate集群,自动处理备份、补丁和版本升级
Weaviate推出的Engram通过智能记忆管理解决AI代理学习时变笨的问题,采用异步处理实现记忆提取、冲突化解和结构化存储。
入选理由:传统方法存在上下文膨胀导致性能退化问题(成本增加300%)
Weaviate通过交互式演示对比关键字、向量和混合搜索算法,帮助工程师直观理解不同搜索机制的差异。
入选理由:BM25关键字搜索依赖TF-IDF评分,擅长精确匹配但忽略同义词
Weaviate 的 Query Agent 能通过自然语言自动构建结构化查询,实现跨数据集合的实时欺诈检测。
入选理由:Weaviate 的 Query Agent 可以将自然语言问题转化为结构化查询,无需 SQL 或查询构建器。
Engram 通过主动整合记忆,避免了 AI 系统中常见的信息冗余和矛盾问题,提升上下文的准确性和清晰度。
入选理由:Engram 不只是存储信息,而是主动整合和更新记忆。
Weaviate 1.38 版本发布,新增 HFresh 和 MCP Server 两项功能,支持大规模数据处理和 AI 集成。
入选理由:HFresh 是 Weaviate 的新磁盘向量索引,适用于百亿级动态数据。