
Fyxer 把 OpenAI 模型与超过 50 万小时行政助理工作流数据结合,将邮件处理拆分为 30-50 个专用模型,并用用户编辑行为做直接偏好优化(DPO)。结果是 90 天留存率 90%,53% 的 AI 草稿被用户原样采纳发送。
在邮件、会议纪要与即时通讯之间穿梭的职场人,最怕的不是信息太多,而是承诺被漏掉。一封看似普通的邮件,对不同收件人意味着完全不同的回复策略——这取决于双方关系、历史上下文以及各自的目标。对 AI 而言,这种「看似简单、实则复杂」的任务恰恰是最难啃的骨头。
Fyxer 联合创始人 Archie Hollingsworth 用莫拉维克悖论(Moravec's paradox)来解释这一困境:人类觉得轻松的事,计算机往往觉得困难。Fyxer 的解法是让 AI 先学会「像一位已经了解你工作方式的助理那样」去回应,而不是套用通用模板。
这家欧洲创业公司把最新 OpenAI 模型与超过 50 万小时的真实行政助理工作流数据结合在一起,把任务拆分给数十个专用模型,并借助用户反馈持续迭代。其成果是:90 天用户留存率达到 90%,AI 生成的草稿中有 53% 被用户原样采纳发送。
Fyxer 没有把邮件处理当作单一的文本生成问题,而是构建了 30 到 50 个专用模型,每个模型只负责邮件工作流中的一个狭窄环节。Hollingsworth 的解释是:「把问题拆成许多小模型,效果远好于让一个大模型直接写出一封好邮件。」
当新邮件到达时,一个「是否需要回复」的分类模型先做判断:这封邮件需要回复、需要安排日程,还是仅需用户知悉即可。若需要回复,后续模型会分析邮件意图并预测互动走向——对话是在走向约会议、解决具体请求,还是延续一段长期关系。
记忆模块是整个系统中最关键的部分之一。Fyxer 必须决定哪些细节应跨对话保留,哪些应在一次交流后消失。新邮件到达时,检索模型会将其与历史交互比对,把与当前联系人和话题最相关的记忆提取出来。OpenAI 模型贯穿其中多个环节,从理解邮件真正在说什么,到拉取并重新排序上下文,再到最终生成邮件内容。
在推出 AI 产品之前,Fyxer 已经运营了多年人工行政助理服务。这段经历积累出一个由超过 50 万小时标注过的行政工作流组成的数据集,记录了真实助理如何处理职业沟通。
这些样本本身就是来自岗位本身的训练数据,捕捉了优秀回复背后的细微判断:什么时候该快速回复,什么时候该等待,哪一段早期对话更重要,以及同一个请求为何对不同人需要不同回应。
Fyxer 在系统中使用监督微调与低秩适配(LoRA,Low-Rank Adaptation)来创建任务专用模型变体,同时控制训练成本。产品早期,团队使用 OpenAI 的微调平台处理对准确率要求高的任务;近期则与 OpenAI 的托管微调团队合作,将一个新的检查点推入生产环境。
Fyxer 的 AI/ML 产品工程师 Joey Dwonczyk 表示,OpenAI 在帮助团队把对客户的理解迁移并融入模型行为方面起到了关键作用。任何模型部署前,Fyxer 都会在围绕自身邮件任务构建的验证集上评估,包括草稿撰写、分类与优先级排序,并在准确率、响应时间与成本之间做权衡,因为不同任务的最优选择并不相同。
系统上线后,Fyxer 通过真实用户反馈持续改进。当用户在发送前编辑草稿时,原始版本与最终版本之间的差异就说明了用户更偏好哪种输出。
Fyxer 使用直接偏好优化(DPO,Direct Preference Optimization)把这些对比转化为训练数据。模型不需要人工逐条标注,而是从成对的输出中学习:原始草稿与用户编辑后的版本。每一次草稿改动都会经过 A/B 测试,只有当新版本带来统计显著提升时,Fyxer 才会正式发布。
这种「部署—反馈—再训练」的闭环,让产品在真实使用中不断逼近用户个人的表达习惯与判断标准。
在海外,Fyxer 代表的是「垂直场景 + 专用小模型 + 用户反馈闭环」的产品思路。国内同类方向同样活跃,但切入点有所不同。
文心一言、通义千问、豆包、Kimi 等产品更强调通用对话与长文本理解能力,在办公场景中通常以插件或独立应用的形式提供邮件润色、会议纪要整理与日程提醒。DeepSeek 与智谱 GLM 则在模型效率与开源生态上发力,吸引开发者自行搭建行业助理。
差异在于数据积累方式:Fyxer 的优势来自多年人工助理服务沉淀的 50 万小时标注工作流,而国内厂商更多依赖通用语料与用户交互反馈。随着企业级 Agent 需求上升,谁能把「个人上下文」与「组织知识」结合得更紧密,谁就更可能在企业办公场景中建立壁垒。
Fyxer 是一款 AI 行政助理,能够跨邮件、会议与消息工具跟踪工作线程,结合 OpenAI 模型与超过 50 万小时行政助理工作流数据,按用户个人语气与上下文起草回复。
它把邮件处理拆分为 30 到 50 个专用模型,分别负责回复判断、意图分析、记忆检索与草稿生成,并通过用户编辑行为进行直接偏好优化(DPO)持续迭代,使输出越来越贴近个人表达习惯。
Fyxer 在邮件理解、上下文检索与重排序、草稿生成等环节使用 OpenAI 前沿模型,并在早期采用 OpenAI 微调平台,近期与 OpenAI 托管微调团队合作将新检查点推入生产环境。
国内文心一言、通义千问、豆包、Kimi 等产品在办公场景提供邮件润色、会议纪要整理等功能,DeepSeek 与智谱 GLM 则侧重模型效率与开源生态,整体更偏向通用能力而非垂直行政助理工作流。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Cognition 将 GPT‑6 Astra 用于 Devin 的测试与验证,让 AI 在写完代码后自行运行、录屏并生成报告,目标是把工程师从逐行审查中解放出来,转向更高价值的判断。

Perplexity将GPT-6 Astra嵌入工程链路,用于撰写沟通文案、修改线上系统、监控生产软件,并让模型自建测试程序模拟外部服务。检查频率大幅降低的背后,是AI从辅助工具向系统托管者的角色跃迁。

OpenAI 的在线存储平台 Habitat 从 Python 客户端库演变为每秒处理 7000 万次请求的分布式系统,支撑每周超 10 亿用户。本文拆解其架构演进逻辑、Python 技术选型的代价,以及国内厂商的平行竞赛。
最新の SEO・GEO 情報をお届けします。
プライバシーを尊重します。いつでも購読を解除できます。