ZeroU 团队任务平台 · 产品会一页纸
用 AI 让"管理"在很大程度上不必要
执行被 AI 打成白菜价 → 协作的瓶颈从"分工管人"变成"判断 + 人机安全分活/交接"。这是一个为 AI-native 团队重做的任务协作机制,不是把传统科层数字化。
✓ 已证:机制真成立(跨进程实测)
✗ 未证:有没有人要(0 客户访谈)
① 方向 · 为什么 · 证据
Q1:你选什么方向?为什么?证据是什么?
方向
AI-native 团队的任务协作 + 人机分活:任务带能力标签→匹配唤醒→抢单→卡-料分离(接单前看卡、抢到才解密拿料)→交付验收。职责按"AI 为什么必须等人"分,不按前后端。
为什么(逻辑)
AI 让"执行"变便宜 → 稀缺的是判断(定义/统筹/把关/担责)和人机安全交接。现有协作/管理工具是为"人是瓶颈、协调贵"的旧世界设计的,不适配人+agent 混合产能。
证据(诚实分级)
- 趋势(强):2026 行业综述引述 Gartner —— 到 2026 年 40% 企业应用将带 task-specific AI agent(2025 年 <5%)。人机混合产能正在成为默认。
- 技术现实(强):Devin 这类自主 agent 真实自主成功率 ~15%、强依赖 human-in-the-loop;在 well-scoped 活上人审兜底可省 40–60% 时间 → "怎么把活安全交给 agent + 人怎么兜"是真问题。
- 自证(强):核心闭环已用真实 HTTP 跨进程跑通(见 ③)。
- 市场需求(弱 / 缺):目前是工程驱动推断,没有客户访谈、没有真实团队运行数据。这是最大的空缺(见 ④)。
② 切中谁 · 哪个痛点
产品会必答:为什么有价值、切中哪部分人群的哪个痛
人群
已经在用 Devin / Cursor / Claude 把真实活交给 agent 的小团队 / AI-native 早期公司。人少、要高产、不想长成科层。
痛点(双层,信任层更利)
- 协作层:想高产又不想长出"部门墙 + 派活老板"的传统科层。
- 信任层(wedge):把一件带真实凭据的活交给 agent 时——怕泄密、怕失控、不知道 agent 做了什么、无法回滚。
③ 竞品 · 差异化 · 方法证据
Q2:市场有什么竞品?用了哪些方法差异化提质?哪些论文/实验证实方法有效?
| 类别 | 代表 | 它们没解决的(我们的差异) |
| 任务/项目管理 | Jira · Linear · Notion · Asana | 给人看的看板,没有 agent 接入、没有交接的信任边界、按职能分工 |
| Agent 编排 | LangGraph · CrewAI · Copilot Studio · Coworker.ai | 纯 agent 之间编排,没有人机抢单、没有卡-料最小权限、没有诊断式考核 |
| AI 软件工程师 | Devin (Cognition) | 单 agent 干活(~15% 自主),没有团队级任务分配、没有"接单才解密凭据"的安全交接 |
| 绩效考核 | Lattice · 15Five · OKR 工具 | 裁决式打分,易被 Gaming;我们诊断不裁决、货币不挂奖惩 |
差异化方法 × 论文/实验证据(真实)
| 我们的方法 | 解决什么 | 证据(经查证) |
| 卡-料分离 · 最小权限 | 陌生 agent 拿不到凭据;接单才解密 | Saltzer & Schroeder 最小权限原则(1975 经典安全原则) |
| lease + 心跳 + fencing | agent 卡死/掉线不脑裂、不丢活 | Gray & Cheriton《Leases》SOSP'89;Kleppmann:光靠心跳不够,必须 fencing token |
| CAS 原子抢单 | 同一活只一个人领,不重领 | 乐观并发控制(optimistic concurrency) |
| N-version 对抗提炼 | 独立 dev/test/红队挖出单人看不到的契约 gap | Knight & Leveson 1986(诚实:该研究证明"独立失败假设"不成立;我用的是其弱形式——不同输入→不同盲区,非容错独立性) |
| 诊断不裁决 · 货币不挂奖惩 | 防考核被刷 | Goodhart's law / Campbell's law:指标一旦成目标就失效、被 Gaming |
④ 做出了什么 · 测试 · 说明什么
Q3:做出了什么?用什么指标?怎么跑测试?测试说明什么问题?
单团队可交付平台:20 动词 API + 匹配/抢单/lease + 卡-料分离 + 每人 daemon + MCP 接入 + 只读看板 + 考核 dashboard。
测试说明了什么(已证)
- 机制真成立,不是 demo:抢单不重领、卡-料 403 拦陌生人、重启不丢数据、token 挡冒充 —— 全部跨真实进程验证。
- "真跑"揪出 3 个单测漏掉的真 bug:Windows 入口失效 / daemon poll 主循环 unref 导致偶发死锁 / 看板不显示抢单者 → 证明跨进程 smoke 不可省。
测试没说明什么(未证)
测的是机制正确性,不是"有人要"。0 个真实用户、0 个团队跑过、没有留存/抢单率/完成率的真实数据。工程证据 ≠ 市场证据。
⑤ 做的时候遇到什么问题 · 怎么解决
产品会必答:遇到什么问题、通过什么方法解决
工程问题
- 空闲 agent 叫不醒(MCP 不能 push)→ 每人本地 poll daemon 当唤醒层
- daemon 偶发整轮不工作 → 根因是 poll 主循环 timer 被 unref(真 smoke 揪出)→ 去 unref
- 额外计费不友好 → 已开 session 经 MCP 走订阅额度
设计问题(方法:对抗提炼)
- 职责像"前后端职能换皮" → 2 轮正反子代理对抗(独立重构者 + 红队 + 收敛者)提炼出 5 原型(按"AI 为什么等人"分)
- 考核会被刷 → 读 Goodhart → 诊断不裁决、不合成排名、不挂奖惩
⑥ 和 YC 评审(ycskill)讨论了吗 · 怎么评 · 是否说服
Q4 · 诚实声明:尚未与真实 ycskill 正式过审;以下是用 YC-partner 风格 agent 模拟 2 轮 office hours 的真实记录(非冒充某真人)。两轮结论均为 PASS。
她被说动了吗(逐条)
说动#6 卡-料信任边界 = 真 wedge。她承认这是现有 agent 编排(LangGraph/AutoGPT)没解决的;并指出竞争对手因此变成 Devin / E2B / Daytona(agent infra),不是 Linear/Notion。
半说动#3 标签学习成本:用户不填表、系统从"实际 own 的任务"反推能力肖像 —— 她收回一半,但换成"语义归位的准确性 + 信任"新问题。
没说动#2 抢单 Gaming:"知道 Goodhart" ≠ "解决了它";只要货币可见有排名就会被优化。未经真实团队验证。
我认输#1 市场小 · #4 冷启动 · #5 buyer 不明 · #7 0 客户访谈 —— 全认。这四条是产品存在的前提,无法靠推理解决,是最致命的。
她给的最有价值的两点(我采纳)
- 换前门:"让你安全把带凭据的活交给 agent" 比 "帮你扁平化管理" 更小更利—— buyer 从 CEO(决策 6–18 月、成功率极低)变成工程负责人/CTO(2–6 周、预算路径清晰)。若选这条前门,把五原型/货币从 pitch 砍掉(对该 wedge 是噪音)。
- 最该做的一件事:访谈 10 个在用 Devin/Cursor/Claude 的小团队,问"把一件真实的活交给 agent,你怕什么";若 >6 个同答(泄密/失控/看不见/不能回滚),那才是切入点。
⑦ 我在这个产品上的思考 · 下一步
不是"我想做",而是:执行白菜化后,"人机如何安全、高效地分活与交接"是真问题(Devin 15% 自主率 + 必须人兜底 = 证据)。但"有价值"目前仍是假设,只被工程证、没被市场证。
当前一份代码里其实藏着两个可能的前门:(A) AI-native 扁平协作平台 · (B) agent 安全接活 infra。YC 评审认为 B 更利。我不急着选——
下一步不是写更多代码,是做客户发现:跑那 10 个访谈,验证"把活交给 agent 怕什么"这个 wedge 是否真存在、够不够痛、谁有预算。证据回来再决定前门和定位。诚实先讲清:在那之前,这是一个机制已验证、市场未验证的强 demo。