ENTERPRISE AI — CAPABILITY · PRODUCTION · OPERATIONS

让 AI 真正进入生产, 而不只停留在演示。

我们和客户团队一起选出值得做的流程,把原型接进真实系统,并在上线后持续关注效果、成本和风险。能力和方法留在企业内部,模型也能按需更换。

  • 共建能力
  • 稳定上线
  • 持续改进
4+2 周常见启动节奏
先用 4 周共建能力;条件具备后,再用约 2 周做生产准备评估
6项生产准备条件
价值、人员、数据、技术、风险和运营
6个交付阶段
从选择流程到持续改进
  • 业务流程与智能体设计
  • 系统接入与权限控制
  • 测试、评估与异常处理
  • 私有化与隔离部署
  • 模型与成本优化
  • 监控、审计与回滚

OUR VIEW

原型能跑,不等于业务能用

真正难的是选对流程、接入真实数据和系统、处理异常与合规,并让团队愿意长期用下去。

我们相信,企业需要的不是对供应商的长期依赖,而是掌握自己的 AI 能力。我们先帮助客户培养内部骨干,共同建立场景判断和验收标准,再协作解决内部团队难以独立完成的生产级问题。因此,能力建设不是交付前的准备,而是交付本身。

WHAT WE DO

从能力建设到持续运营,三类服务

我们帮助客户培养内部能力,把值得做的流程稳定上线,并在上线后继续改进。

  1. 企业 AI 能力建设

    4 周 · 围绕真实业务任务

    我们和客户团队一起拆解真实流程,找出关键规则、异常和人工复核点,在受控环境验证最小方案,并培养内部负责人。

    • 一份看清现状与问题的流程基线
    • 经过真实任务测试的最小方案
    • 内部负责人和明确的下一步
    查看具体怎么做:企业 AI 能力建设

    「4+2」是一种常见的启动方式,不是固定工期。前 4 周用于能力建设和真实任务验证;当数据、权限、相关人员和审批条件具备时,生产准备评估通常约需 2 周。后续验证、工程开发、上线和运营会与客户另行确定计划。

    第 1 周
    梳理工作流程、实际使用者、相关系统和当前业务表现
    第 2 周
    拆解规则、异常和人工复核环节,在受控环境中构建最小原型
    第 3 周
    建立首轮测试与验收标准,验证数据、权限、价值和风险,并明确实际使用所需的条件
    第 4 周
    确定内部负责人、流程优先级和下一步建议:推进、补充验证或暂缓

    这些产出用来帮助客户判断:哪些任务可以自行推进、哪些需要工程支持、哪些需要补充验证或暂缓。

  2. 生产部署与工程交付

    联合工程交付(FDE)· 范围明确的生产项目

    条件具备后,我们把通过评估的流程接入真实系统,并按上线前的六项条件逐项补齐缺口。

    • 能接入现有系统的生产工作流
    • 按双方约定标准完成的上线前测试
    • 运行手册、验收记录和已知限制
    查看具体怎么做:生产部署与工程交付

    项目中形成的测试方法、系统接入组件和流程模板,会按合同约定交付给客户,减少后续重复工作。

    工程
    工作流自动化、系统连接、权限控制、日志和监控
    测试
    覆盖正常、边界、异常和恶意输入,并验证系统何时应拒绝处理
    发布
    根据流程风险和技术条件,选择离线测试、隔离验证、不影响现有流程的试运行和分阶段上线等适用步骤
    交接
    运行手册、回滚演练、用户验收和已知限制记录

    交付是否完成,以双方约定的实际业务量、质量、安全、人工接管和回滚标准为准。

  3. 持续运营与优化

    上线后的持续运营

    上线后,我们按约定跟踪使用、质量、成本和变更,支持客户持续优化。

    • 持续跟踪使用、质量、成本和风险
    • 变更前先评估、测试和审批
    • 根据实际价值决定优化、缩小或下线
    查看具体怎么做:持续运营与优化

    项目开始前,双方会明确谁批准生产变更、谁负责日常运营和异常处理,以及支持时间和响应要求。

    价值
    用统一口径对照上线前基线,复盘使用率和业务指标
    质量
    定期复测、抽查线上结果并安排人工复核
    变更
    模型、提示词、系统连接和业务规则的变更都要经过评估、测试和批准
    成本
    关注成功完成每项任务的总成本,而不只看模型调用单价

    如果系统不再创造持续价值,我们会建议缩小范围、暂停或下线。

DELIVERY PROCESS

六个阶段,从流程选择到持续改进

项目分六个阶段。每一步都说清要做什么、谁负责、达到什么条件才能继续。

选择阶段查看详情

发现

哪些工作流程值得用 AI 改进?

先把“想用 AI”变成范围、负责人、现状指标和数据条件都清楚的候选流程。

阶段成果

  • 候选流程清单
  • 业务指标基线
  • 数据与责任清单

进入下一阶段前

至少有一个流程的价值、负责人和数据授权已经明确。

能力建设

谁能在企业内部掌握并持续推动这项能力?

围绕真实任务培养内部 AI 骨干,并用授权环境中的原型验证判断和推进能力。

阶段成果

  • 内部负责人及职责
  • 原型测试结果
  • 流程评估

进入下一阶段前

内部骨干能独立说明流程、限制和升级方式,原型可以在授权环境中稳定复测。

生产准备

哪些流程已经具备进入生产部署的条件?

一起确认价值、人员、数据、技术、风险和运营条件,再决定是否进入生产开发。

阶段成果

  • 生产准备评估
  • 行动计划
  • 生产范围说明

进入下一阶段前

关键条件已确认,未完成事项都有负责人和期限。

部署

如何在真实数据、系统与组织约束下可靠上线?

把通过评审的流程真正接进生产环境,并完成上线前约定的全部验证。

阶段成果

  • 评测与验收方案
  • 系统接口与架构说明
  • 发布与回滚方案

上线前

关键问题已解决,上线前的验证和用户验收已经完成。

运营

如何持续管理业务价值、质量、安全与成本?

上线后持续看系统稳不稳、团队用不用、业务有没有改善。

阶段成果

  • 运营看板
  • 事件与变更记录
  • 业务价值复盘

本周期复盘

每个周期都对照上线前基线复盘效果,不用调用量代替业务价值。

复用与改进

如何把本次项目经验安全地用于后续迭代?

在合同和客户授权范围内,整理可复用的方法、测试和组件,并明确所有权、版本和适用范围,减少后续重复工作。

阶段成果

  • 授权与所有权清单
  • 版本和适用范围
  • 可复用工具与模板

复用前

复用前确认合同权利、数据边界和第三方许可证;材料不得包含客户数据、机密信息或可识别内容,并使用合成、公开或客户授权数据重新测试。

各阶段时间取决于项目范围和风险,具体工期以项目合同为准。

PRODUCTION READINESS

开始生产开发前,先回答六个问题

进入开发前,双方先把六件事确认清楚:值不值得做、谁负责、数据能不能用、技术接不接得上、风险能不能控、上线后谁来运营。价值不清或重大风险未解决,就先不做。

  1. H1

    业务价值

    有真实问题和可衡量目标吗?

    查看确认内容:业务价值

    明确当前表现、目标指标、预期处理量、预期收益和统一计算口径,把“提效”落实为可衡量的结果。

    通常参与评审客户业务负责人

  2. H2

    负责人和投入

    谁负责、谁验收,资源到位吗?

    查看确认内容:负责人和投入

    明确项目发起人、业务负责人、内部 AI 骨干、预算与采购路径、验收负责人和问题升级方式。

    通常参与评审客户项目发起人

  3. H3

    数据条件

    数据能合法、安全、稳定使用吗?

    查看确认内容:数据条件

    确认数据清单、使用授权、分类分级、样本质量、留存与删除要求,并由数据负责人确认。

    通常参与评审客户数据负责人,以及按需参与的隐私、法务或安全负责人

  4. H4

    技术可行性

    系统接得上,效果和成本过关吗?

    查看确认内容:技术可行性

    确认目标架构、系统接口与连接方案、候选模型测试结果、主要依赖、容量和成本估算。

    通常参与评审Futura 工程负责人和客户 IT 负责人

  5. H5

    风险可控

    出错后能发现、复核、接管和回滚吗?

    查看确认内容:风险可控

    明确风险等级、人工复核与接管方式、权限和审计要求、涉及的第三方服务商,并制定安全攻击、误用和回滚测试的计划、负责人和验收标准。

    通常参与评审客户风险、安全、隐私或法务负责人,以及 Futura 项目负责人

  6. H6

    运营准备

    上线后谁负责效果、异常和变更?

    查看确认内容:运营准备

    明确服务目标和责任分工、运行手册、异常处理负责人、推广使用计划和后续运营预算。

    通常参与评审客户流程负责人和 Futura 项目负责人

数据授权或关键安全要求未满足,系统不上线。可管理的风险要写清负责人、措施和批准方式。

TECHNOLOGY & DATA

技术与数据原则

客户需要看清两件事:模型怎么选,数据怎么用。

模型由任务决定,不由供应商决定

我们按真实任务选择模型,并为以后更换保留路径。切换需要的工作、成本和限制会提前说明。

  • 先用真实任务定标准,再选模型
  • 同时比较效果、风险、速度和总成本
  • 切换前重新测试,不只看公开榜单
查看模型选择细节

模型和价格会持续变化。我们通过真实任务测试、接口设计和交接安排,减少关键流程对单一供应商的不必要依赖。后续更换模型仍需重新测试,并可能产生开发和迁移成本。

  1. 先根据真实任务确定测试方法、验收标准和不能接受的结果,再选择模型。有两个以上可行方案时,至少比较两个。
  2. 同时比较任务效果、风险、响应速度、处理能力、每项成功任务的总成本、部署约束,以及更换或退出供应商的条件。
  3. 项目需要时,我们会用客户认可的统一接口管理不同模型的调用、认证、日志和版本,并分别保存提示词、工具接口、业务规则和测试配置,便于审计和更换模型。
  4. 可根据项目范围和技术可行性,设计公有 API、客户专有云、本地或隔离环境方案,并尊重客户已有的云和模型选择。
  5. 切换模型或供应商前,会按双方约定的测试范围完成验证;不会仅因新模型公开评测得分更高就切换。每次选择及其依赖风险都会写入架构决策记录。

客户如何确认

客户可以查看候选模型、选择理由和未来更换方案。在模型能力和接口具有可比性时,可使用同一套核心测试进行比较;对于关键流程,双方会根据风险、技术可行性和项目范围评估备用模型或人工接管方案。

客户数据只在授权范围内使用

客户数据、内部规则和商业秘密只在批准范围内处理;可复用内容不得包含客户信息。

  • 客户数据只按合同和授权处理
  • 未经书面许可,不跨客户复用
  • 项目结束后按合同返还、删除或保留
查看数据边界细节

仅按客户授权和合同约定处理

  • 原始数据,或仍有可能重新识别个人或客户的数据
  • 凭证、权限、内部 URL、系统拓扑与安全弱点
  • 未公开的业务规则、定价、名单与合同
  • 包含客户内容的提示词、日志、标准测试集和演示录屏
  • 未经单独书面授权的模型训练用途和公开评测用途

合同允许时可复用的通用方法与工具

  • 不包含客户数据、内部业务规则、商业秘密或可识别信息的通用工作流和接口模式
  • 基于合成数据、公开数据或客户单独授权数据建立的测试方法与测试集
  • 不包含客户特定内容的常见失败模式和复测用例
  • 系统连接模式与治理模板
  • 经客户事先书面授权、且无法关联到特定客户的汇总指标

如何执行

在 Futura 管理的环境中,所有访问都使用实名账号,只授予完成工作所需的最低权限,并设置有效期和审计记录。开发、测试和生产环境会按项目风险要求隔离。客户自有环境中的权限和责任,由双方在项目开始前确认。数据授权不明确时,我们会暂停处理;Futura 持有的数据会在项目结束后按合同返还、删除或保留。

WHERE WE START

什么样的项目适合先做

这类流程目标和规则清楚,效果可以衡量,但仍需要专业人员处理异常;结果还要写回现有系统,出错会影响成本、客户体验或合规。

适合启动的条件

  • 有真实数据和业务负责人,希望从验证推进到生产
  • 流程规则多、异常多,需要人工复核并连接多个系统
  • 效果可以用错误率、周期、业务量或成本建立基线

我们重点服务的领域

  • 保险理赔、核保与第三方服务管理

    规则复杂、需要人工复核的理赔与核保流程

  • 能源与工业

    合同、台账和其他规则明确的工业流程

  • 合同与合规

    条款审查、义务梳理和审批流程

  • 文档处理流程

    需要专业判断和跨系统处理的流程

我们目前重点服务以上领域。是否适合合作,最终取决于具体流程、数据基础和风险要求。

未经客户书面授权,我们不披露客户名称、流程细节或量化结果。

THE TEAM

跨学科团队,直接参与项目交付

四位核心成员覆盖 AI 工程、流程设计、生产交付、产品与合规,并按项目需要直接参与。

  • 张庭瑞

    技术与智能体架构

    清华大学人工智能学院博士生。负责模型选择、AI 智能体设计、业务工具接入和系统架构,重点提升系统的可维护性,并为后续更换模型保留可行路径。

  • 赵家杰

    AI 能力建设与流程设计

    清华大学建筑学院博士生,哥伦比亚大学 GSAPP 高级建筑设计硕士,曾在哥伦比亚大学与雪城大学任教。负责能力建设与流程设计,帮助客户梳理复杂业务、建立判断和验收标准,并培养内部团队持续推进项目的能力。

  • 秦一骅

    生产部署与交付

    清华大学人工智能学院博士生,数理基础科学与机械工程双学位。负责将原型开发成可稳定运行、便于维护并具备回滚方案的生产系统,同时制定测试和发布标准。

  • 林桐宇

    产品与合规

    清华大学人工智能与法学双学位,曾任职于 Manus、字节跳动。负责产品需求、客户沟通和合规工作,并参与梳理数据使用规则和项目管理规范。

GET IN TOUCH

从一次 30 分钟的业务沟通开始

带一个具体流程来。30 分钟内,我们一起判断值不值得做、还缺什么、下一步怎么走。