
Legora 的实测显示,GPT-6 Astra 能在几分钟内完成 41 份财务文件的交叉核对,并准确找出全部 4 处预设错误,性能较上一代模型提升近 40%。这表明 AI Agent 已能在法律、财务等专业场景中承担繁琐的核查工作,但最终决策仍需人类专家把关。
在生成式 AI 的落地进程中,一个常见的质疑是:大模型在创意写作或代码生成上表现出色,但在需要高度精确、容错率极低的企业级专业场景中,究竟能发挥多大作用?近期,欧洲法律科技公司 Legora 公布的一组测试数据,为这个问题提供了一个极具参考价值的注脚。
Legora 是一家专注于法律与专业服务领域的智能体操作系统(Agentic Operating System)公司。其平台已被全球超过 50 个市场的 1800 多家企业内部法务部和律师事务所采用,服务超过 10 万名专业人士。Legora 的核心理念并非用 AI 取代律师,而是通过与其法律工程师的深度协作,将 AI 无缝嵌入从合同审查到法律研究的端到端工作流中。
在 Legora 处理的诸多流程里,财务报表勾稽核对(Financial-Statement Tie-Out) 堪称最繁琐的任务之一。这项工作需要将草拟财务报表中的每一个数字,与试算平衡表、合并报表附注及上一年度账目逐一比对,直至所有项目完全吻合。正如 Legora 法律工程师 Percevale Perks 所言,这项工作“常常要耗上一整个晚上,有时甚至需要数天”。
这类工作对人类专家而言是巨大的时间和精力消耗,但对具备强大上下文处理能力的 AI Agent 而言,却可能是一个理想的用武之地。
Legora 近期利用 OpenAI 最新一代模型 GPT-6 Astra(通过 API 接入)进行了一项内部测试。测试内容正是上述的财务报表勾稽工作。结果令人印象深刻:
Percevale Perks 指出,这一提升体现在三个维度:准确性(Accuracy)、完整性(Completeness) 与 可靠性(Reliability)。新模型不仅完整保留了上一代模型所有正确的检查项,还额外完成了约 50 项检查,为法律专家提供了更详尽、颗粒度更细的复核记录。
值得注意的是,虽然在该特定工作流中提升显著,但在 BAR 基准涵盖的所有任务中,平均性能提升约为 3%。这组数据说明,模型的性能增益在不同任务类型上存在显著差异,在需要长文本理解与复杂逻辑比对的场景中,新一代模型的优势更为突出。
Legora 的实践揭示了一个重要的产品设计思路:AI 并非替代人类专家,而是作为强大的“副驾驶”,负责处理最耗时、最繁琐的比对与核查工作,而最终的职业判断与决策权始终保留在人类专家手中。
这种“人在回路”(Human-in-the-Loop)的协作模式,在 Legora 看来是其平台从法律工作向审计、税务、合规及风险管理领域扩展的核心基石。通过让 AI 完成“穷举式”的检查,人类专家得以将宝贵的精力聚焦于异常项的分析与最终决策,从而提升整体工作质量与效率。
从更深层次看,这代表了专业服务领域 AI 应用的一种演进方向:从提供“参考意见”的工具,转变为能够执行完整任务流、并产出结构化工作记录的智能体。这种转变使得 AI 的应用效果变得可量化、可审计,这对于法律、金融等强监管行业而言,是走向规模化应用的关键前提。
Legora 与 GPT-6 Astra 的案例,也为我们观察国内 AI 市场提供了参照。在国内,以 百度文心一言、阿里通义千问、DeepSeek、智谱 GLM 等为代表的大模型平台,同样在积极向法律、金融等专业服务领域渗透。
与 Legora 这类垂直整合型公司不同,国内厂商更多采取“大模型平台 + 行业解决方案”的模式。例如,通义千问在法律文书生成、案例检索方面有专项优化;智谱 GLM 则强调其智能体开发平台,赋能开发者构建特定场景的 Agent。在“AI 负责执行、人类负责决策”的产品哲学上,国内厂商与 Legora 是高度一致的。然而,在底层模型的特定任务能力(如长时间、多文档的精确比对)以及行业 Know-how 的深度耦合(如 Legora 法律工程师的贴身服务模式)上,国内生态仍需时间沉淀。
Legora 的案例表明,AI Agent 正从“能说会道”的聊天机器人,进化为“能干细活”的数字员工。当模型的能力足以处理复杂、长尾的专业任务时,企业级服务市场将迎来一轮深刻的效率革命。
当然,这并不意味着法律专家会失业。恰恰相反,AI 的介入将把专家从重复性劳动中解放出来,迫使他们将核心竞争力转向更高阶的领域:复杂的商业谈判策略、创造性的交易结构设计,以及对 AI 输出结果的终极问责。未来的专业服务,将愈发依赖“人机协同”的智慧,而非单一个体的苦劳。
对于企业决策者而言,Legora 的这组数据提供了一个清晰的信号:评估新一代 AI 模型时,不应只看基准测试的分数,更应关注其在真实业务工作流中的端到端表现。只有当 AI 能在具体的业务场景中,像 Legora 这样交出“41份文件、几分钟、零遗漏”的答卷时,其商业价值才真正得以彰显。
GPT-6 Astra 是 OpenAI 推出的新一代多模态大模型(注:根据原文语境为未来版本),通过 API 向开发者提供,具备更强的长文本处理、复杂推理与多步骤任务执行能力。在 Legora 的测试中,它展现了对大量文档的快速消化与精确比对能力。
财务报表勾稽核对是审计与财务工作中的一项关键流程,要求将财务报表中的每个数字与总账、试算平衡表、明细附表及上年度数据进行逐一比对,以确保所有数据来源清晰、逻辑一致、金额相符。
测试结果显示,GPT-6 Astra 能在几分钟内完成 41 份文件的交叉核对,并准确找出所有预设错误。相比上一代模型,该工作流的效率与准确性提升了近 40%,证明了 AI Agent 在专业、复杂的文档处理场景中具备显著的实用价值。
Legora 的实践表明,AI 目前主要承担繁琐的核查与数据比对工作,而最终的职业判断、决策与责任仍由人类专家承担。这种“人在回路”的模式旨在增强而非取代人类专家的能力。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Fyxer 将 OpenAI 模型与 50 万小时行政助理工作流数据结合,用 30-50 个专用模型拆解邮件处理,并通过用户编辑反馈持续优化,实现 90 天留存率 90%、53% 草稿被原样采纳。

Cognition 将 GPT‑6 Astra 用于 Devin 的测试与验证,让 AI 在写完代码后自行运行、录屏并生成报告,目标是把工程师从逐行审查中解放出来,转向更高价值的判断。

Perplexity将GPT-6 Astra嵌入工程链路,用于撰写沟通文案、修改线上系统、监控生产软件,并让模型自建测试程序模拟外部服务。检查频率大幅降低的背后,是AI从辅助工具向系统托管者的角色跃迁。
최신 SEO·GEO 정보를 받아보세요.
개인정보를 존중합니다. 언제든 구독을 취소할 수 있습니다.