VisionOps

让视觉AI技能自我生长、自我优化、自我运营。

VisionOps 是一个面向长尾视觉场景的 AI Agent 平台,帮助业务人员用自然语言定义需求,自动完成视觉技能的需求分析、数据构建、模型训练、技能编排、评测和持续优化。它面向零售、制造、物流、质检、内容审核等场景,把原本依赖算法团队反复手工迭代的流程,变成可持续运转的自治闭环。

Business Goals

  • 在上线后 6 个月内,累计创建 300 个可运行的视觉技能,覆盖至少 20 个行业长尾场景。
  • 在 12 个月内,将单个视觉技能从需求到首版上线的平均交付周期从 3-6 周缩短到 3 天以内。
  • 在 9 个月内,使付费客户的 90 天留存率达到 45% 以上,核心原因是技能可持续优化而不是一次性交付。
  • 在 12 个月内,将从自然语言需求到首个可用技能的转化率提升到 35% 以上。
  • 在 12 个月内,使平台上由自动化流水线生成的数据集、训练任务和评测任务占比达到 70% 以上。

User Goals

  • 业务人员可以直接用自然语言描述视觉需求并获得可执行方案。
  • 用户可以快速生成或接入数据集,并自动完成标注校验和质量筛查。
  • 用户可以一键训练、部署和版本化管理视觉技能。
  • 用户可以持续查看技能效果、定位失败样本并触发再训练。
  • 用户可以把多个视觉技能编排成业务流程,减少人工介入。

Non-Goals

  • 不做通用大模型聊天产品,不提供开放式闲聊能力。
  • 不优先支持纯文本、语音或多模态生成内容创作场景。
  • 不做面向研究员的底层算法训练框架替代品,重点是业务闭环和运营。
  • 不承诺在首版支持所有行业的复杂 3D、视频时序和多摄像头融合场景。

制造质检经理 周敏,38岁 - 负责产线外观缺陷识别和质检标准落地,希望减少人工抽检压力。她不懂算法细节,但需要快速定义缺陷类型并跟踪识别效果。

制造质检经理 周敏,38岁

  • As a 质检经理, I want to 用自然语言描述缺陷规则和验收标准, so that 系统可以自动生成对应的视觉技能方案。
  • As a 质检经理, I want to 查看误检和漏检样本, so that 我能和团队快速确认规则是否需要调整。
  • As a 质检经理, I want to 在新产线复制已有技能模板, so that 我可以更快上线而不从零开始。

零售运营主管 李航,31岁 - 负责门店陈列合规、货架缺货和促销物料检查,需要跨门店快速复制视觉检查能力。

零售运营主管 李航,31岁

  • As a 零售运营主管, I want to 一次创建多个门店的检查任务, so that 我可以批量运营不同区域的视觉技能。
  • As a 零售运营主管, I want to 看到每个门店的技能通过率和异常排名, so that 我能优先处理高风险门店。
  • As a 零售运营主管, I want to 通过规则更新自动触发再训练, so that 新活动和新陈列能快速适配。

算法平台工程师 陈澈,29岁 - 负责企业内部 AI 平台与系统集成,需要让业务团队自助创建技能,同时保证安全、权限和可观测性。

算法平台工程师 陈澈,29岁

  • As a 平台工程师, I want to 统一接入模型训练和推理资源, so that 我能控制成本并避免重复建设。
  • As a 平台工程师, I want to 审核技能发布前的权限和数据范围, so that 我能降低合规风险。
  • As a 平台工程师, I want to 监控训练、评测和线上推理链路, so that 我能快速定位性能和稳定性问题。

自然语言需求编排 · High priority

  • 将业务语言转成结构化视觉任务定义,并引导用户完成需求澄清。
  • 支持中文自然语言输入,自动识别任务类型,如分类、检测、分割、OCR、异常检测。
  • 当需求信息不足时,自动追问关键字段,如目标对象、场景、容错标准、输出格式。
  • 生成可编辑的技能规格书,包括输入、输出、指标、数据需求和风险提示。
  • 支持模板化创建,按行业和场景复用既有配置。

数据构建与治理 · High priority

  • 自动组织数据采集、筛选、标注与版本管理,确保训练数据可追溯。
  • 支持从对象存储、S3、OSS、GCS、数据库和上传文件导入图片。
  • 对重复、模糊、低质量或疑似泄露样本做自动筛查并提示处理。
  • 提供标注任务分发、抽样复审和一致性检查。
  • 每个数据集都保存版本、来源、标签字典和变更记录。

模型训练与评测 · High priority

  • 自动选择训练策略、启动训练任务并输出可解释的评测结果。
  • 根据任务类型自动推荐模型和训练方案,例如 YOLO、Detectron2、MMDetection、PaddleOCR。
  • 支持训练前基线评测、训练中指标跟踪和训练后阈值调优。
  • 输出按业务定义的核心指标,如漏检率、误检率、召回率、mAP 和 Top-1 准确率。
  • 当指标不达标时自动建议补数、重标或调整阈值。

技能部署与编排 · Medium priority

  • 将训练好的技能发布为可调用服务,并支持多个技能串联成工作流。
  • 提供技能版本管理、灰度发布和回滚能力。
  • 支持 API、Webhook 和定时任务触发。
  • 允许将多个视觉技能串成流程,例如先检测再 OCR 再规则判断。
  • 支持基于角色的发布审批和环境隔离。

持续优化与运营 · High priority

  • 通过线上反馈、失败样本和监控闭环,持续提升技能效果。
  • 自动汇总线上误判样本和低置信度样本进入待复审队列。
  • 支持用户标记样本为正确、错误或待确认,并触发再训练建议。
  • 提供技能健康度面板,展示数据漂移、指标变化和最近一次优化效果。
  • 支持定期训练计划和事件触发训练。

首次创建视觉技能

  • 用户进入控制台后先选择行业模板或直接输入一句业务需求。
  • 系统在 30 秒内解析任务类型、输出需求摘要并标出缺失信息。
  • 用户补充少量关键字段,如场景、目标、判定标准和数据来源。
  • 系统自动生成数据计划、训练计划和评测标准,用户确认后进入执行。
  • 第一版技能在 1 小时内完成首轮训练或给出可用的预训练基线结果。
  • 用户获得可部署版本和改进建议,完成从需求到可用技能的首次闭环,目标首次可见价值时间小于 60 分钟。

1. 描述需求

  • 用户用自然语言描述业务场景,系统解析成结构化任务。
  • 自动识别任务类型和关键实体。
  • 若存在歧义,给出 3-5 个澄清问题而不是盲目执行。
  • 支持行业模板一键填充。

2. 生成方案

  • 系统输出技能规格、数据需求和推荐流程。
  • 显示目标指标、所需样本量和潜在风险。
  • 给出可编辑的标签体系与输出格式。
  • 若样本不足,提示采用小样本或预训练基线。

3. 构建数据

  • 用户导入或连接数据源后,系统自动筛选和组织数据集。
  • 重复、空白、低清图像自动标记。
  • 支持人工抽检与批量修正。
  • 异常导入时返回错误原因和修复建议。

4. 训练与评测

  • 系统执行训练任务并生成评测报告。
  • 训练过程实时展示状态、耗时和资源消耗。
  • 评测结果按业务阈值标红或标绿。
  • 若未达标,给出最可能的改进路径。

5. 发布与优化

  • 用户将技能发布到线上并持续观察表现。
  • 支持灰度发布到指定门店、产线或业务线。
  • 线上样本回流形成待处理队列。
  • 一键触发再训练或回滚到上一个稳定版本。

高级能力

  • 多技能编排为端到端视觉工作流。
  • 跨项目技能模板市场,支持企业内复用。
  • 自动阈值寻优和业务指标映射。
  • 主动发现数据漂移并建议补数。
  • 多租户权限、审批流和审计日志。

界面与交互原则

  • 首页以技能健康度和待办事项为中心,而不是模型参数。
  • 训练和评测结果采用红黄绿状态与业务语言解释,降低算法门槛。
  • 对大批量图片操作提供分页、批处理和拖拽上传,避免卡顿。
  • 全站支持中文优先、键盘可访问和高对比度模式。
  • 关键链路显示进度、预计完成时间和失败重试入口。

周敏以前每次新增一条缺陷规则,都要把需求写给算法同事,再等数据标注、训练和评测,往往两三周后才拿到第一版结果。等结果上线后,新的缺陷样本又不断出现,整个流程像在追着问题跑。

接入 VisionOps 后,她只需输入“检测手机壳表面划痕、凹陷和色差,按严重程度分级”,系统就自动生成任务定义、数据需求和评测标准。她上传历史质检图片后,平台自动筛选、训练并给出可部署版本,还会把误判样本持续回流到再训练队列。

两周后,产线的漏检率明显下降,质检人员从重复抽检中解放出来,能够把精力放在规则制定和异常处理上。对企业来说,视觉技能不再是一次性交付的项目,而变成可持续运营、可复制扩张的能力。

User-Centric Metrics

  • 首版技能从需求输入到可用结果的中位时间小于 60 分钟。
  • 80% 以上的新技能在 3 次迭代内达到业务验收阈值。
  • 用户每周主动查看技能健康度的比例达到 60% 以上。
  • 线上误判样本的平均处理关闭时间小于 48 小时。
  • 数据导入成功率达到 95% 以上。
  • 用户对自动生成方案的满意度达到 4.5/5 以上。

Business Metrics

  • 6 个月内付费转化率达到 20% 以上。
  • 90 天留存率达到 45% 以上。
  • 月活跃创建技能客户数每月增长 15% 以上。
  • 每客户平均技能数在 12 个月内达到 8 个以上。

Technical Metrics

  • 核心 API 可用性达到 99.9%。
  • 页面与任务列表首屏加载时间小于 2 秒。
  • 训练任务状态更新延迟小于 5 秒。
  • 敏感数据访问和发布操作 100% 留痕审计。

Tracking Plan

  • track idea_submitted when user enters natural language requirement.
  • track clarification_question_answered when user completes missing fields.
  • track dataset_connected when a data source is imported successfully.
  • track training_job_started when a training run is launched.
  • track evaluation_report_viewed when the user opens metrics and failure analysis.
  • track skill_published when a version is deployed to a target environment.
  • track feedback_sample_labeled when a user marks an online sample as correct or incorrect.

Technical Needs

  • 前端建议使用 Next.js + React + TypeScript,支持复杂表单和实时状态。
  • 后端建议使用 FastAPI 或 NestJS,拆分任务编排、数据管理和权限服务。
  • 异步任务队列建议使用 Celery + Redis 或 Temporal,用于训练、评测和导入流程。
  • 模型与推理编排可对接 Kubeflow、Ray 或自建 Kubernetes Jobs。
  • 文件存储使用 S3 兼容对象存储,元数据使用 PostgreSQL。
  • 检索和日志分析可使用 OpenSearch 或 Elasticsearch。
  • 监控与告警建议接入 Prometheus、Grafana 和 Sentry。

Integration Points

  • 企业 SSO,如 Azure AD、Okta 或 Google Workspace。
  • 对象存储,如 AWS S3、阿里云 OSS 或腾讯云 COS。
  • 标注与审核工具,如 Label Studio。
  • 消息通知,如 Slack、飞书或企业微信。
  • 模型推理或训练云资源,如 Kubernetes、AWS SageMaker 或自建 GPU 集群。

Data Storage & Privacy

  • 区分业务图片、标注结果、模型产物和审计日志的存储权限。
  • 支持数据集级别的访问控制、脱敏和删除请求,满足 GDPR/CCPA 相关要求。
  • 对上传图片中的敏感信息提供可选打码或水印策略。
  • 保留数据来源、标注人、版本和发布记录,便于追溯。
  • 默认关闭跨租户数据共享,所有复用必须显式授权。

Scalability & Performance

  • 图片上传与预处理必须异步化,避免阻塞主流程。
  • 任务编排需要支持并发训练和批量评测,至少可横向扩展到每租户 50 个并发任务。
  • 首页仪表盘采用增量加载和缓存,避免大项目下列表卡顿。
  • 高峰期任务状态轮询改为事件推送或 WebSocket。

Potential Challenges

  • 自然语言需求歧义导致任务定义错误,缓解方式是强制澄清关键字段并提供模板。
  • 数据质量参差不齐影响模型效果,缓解方式是自动质检、抽样复审和置信度提示。
  • GPU 成本不可控,缓解方式是训练队列限流、按需调度和基线优先策略。
  • 业务用户对指标理解不足,缓解方式是将模型指标映射为业务语言并提供示例解释。
  • 多租户与合规风险较高,缓解方式是 RBAC、审计日志、加密存储和发布审批流。

Team & resourcing - 小团队 - 2 名后端工程师,1 名前端工程师,1 名全栈/平台工程师,1 名设计师,兼职 PM 和算法顾问。

Phase 1: MVP 需求到技能规格 · Weeks 1-4

  • 自然语言需求输入与澄清问答。
  • 行业模板库的首批 5 个场景。
  • 技能规格书生成页面。
  • 基础账号体系和项目管理。

Phase 2: 数据与训练闭环 · Weeks 5-8

  • 数据集导入、版本管理和自动质检。
  • 训练任务编排与状态监控。
  • 首版评测报告与阈值对比。
  • 与 Label Studio 的标注集成。

Phase 3: 发布与优化 · Weeks 9-12

  • 技能版本发布、灰度和回滚。
  • 线上样本回流与反馈标注。
  • 技能健康度面板。
  • 自动再训练建议与通知。

Phase 4: 企业化与扩展 · Weeks 13-16

  • SSO、RBAC 和审计日志。
  • 多技能工作流编排。
  • 成本与资源监控。
  • 更丰富的行业模板和复用能力。

Paste this into Cursor, Bolt, Lovable, or v0 to start building.

Build a web app called VisionOps, a multi-tenant AI agent platform for creating, training, evaluating, deploying, and continuously optimizing vision AI skills for long-tail business scenarios.

Core users: business operators, QA managers, retail ops, and platform engineers. The app must let users describe a vision need in natural language, ask clarifying questions, generate a structured skill spec, connect/upload datasets, run training jobs, evaluate performance, deploy versions, and monitor feedback loops for retraining.

Use a modern stack: Next.js, TypeScript, Tailwind CSS, shadcn/ui, FastAPI backend, PostgreSQL, Redis queue, S3-compatible object storage, and optional WebSocket updates for job status.

Primary screens/flows:
1) Auth and org/workspace selection with SSO-ready design
2) Home dashboard showing skill health, active jobs, failed samples, and pending actions
3) New Skill flow: natural language input, auto-parsed task type, clarifying questions, editable skill spec
4) Dataset workspace: import files, connect S3/OSS, version datasets, quality checks, label review queue
5) Training workspace: start jobs, choose model/template, monitor progress, compare metrics, cancel/retry
6) Evaluation report: business-friendly metrics, confusion/error samples, threshold tuning suggestions
7) Deployment page: versioning, staging/prod deploy, rollback, webhook/API endpoint display
8) Optimization loop: feedback queue, sample labeling, retraining recommendations, audit trail

Data model should include: Organization, User, Project, Skill, SkillVersion, Dataset, DatasetVersion, Sample, Label, TrainingJob, EvaluationReport, Deployment, FeedbackSample, Workflow, AuditLog, Notification.

Functional requirements: natural language parsing with clarification, dataset ingestion and validation, automated training orchestration, evaluation and threshold optimization, versioned deployment, continuous feedback and retraining, RBAC and audit logging.

UI should be enterprise-friendly, Chinese-first ready, fast, accessible, and focused on operational status rather than model internals. Include empty states, loading states, error handling for bad uploads and insufficient data, and real-time job progress.

Generate a polished MVP with seed data, realistic dummy dashboards, and clean component architecture so the app can be extended into a production VisionOps platform.

Business Idea

产品定位:面向长尾视觉场景,能够自主生产、优化、运营视觉AI技能的智能体平台。 核心目标:以AI Agent为核心,构建VisionOps自治闭环,使业务人员仅需通过自然语言描述业务需求,即可完成视觉技能从需求分析、数据构建、模型训练、技能编排、效果评测到持续优化的全生命周期管理。

Make My PRD

Design by The Resonance | Powered by GPC – The AI Transformation Company

    PRD: 产品定位:面向长尾视觉场景,能够自主生产、优化、运营视觉AI技能的智能体平台。 核心目标:以AI...