ZeroU 团队任务平台 · 产品会一页纸

用 AI 让"管理"在很大程度上不必要

执行被 AI 打成白菜价 → 协作的瓶颈从"分工管人"变成"判断 + 人机安全分活/交接"。这是一个为 AI-native 团队重做的任务协作机制,不是把传统科层数字化。

✓ 已证:机制真成立(跨进程实测) ✗ 未证:有没有人要(0 客户访谈)

① 方向 · 为什么 · 证据

Q1:你选什么方向?为什么?证据是什么?
方向

AI-native 团队的任务协作 + 人机分活:任务带能力标签→匹配唤醒→抢单→卡-料分离(接单前看卡、抢到才解密拿料)→交付验收。职责按"AI 为什么必须等人"分,不按前后端。

为什么(逻辑)

AI 让"执行"变便宜 → 稀缺的是判断(定义/统筹/把关/担责)和人机安全交接。现有协作/管理工具是为"人是瓶颈、协调贵"的旧世界设计的,不适配人+agent 混合产能。

证据(诚实分级)

② 切中谁 · 哪个痛点

产品会必答:为什么有价值、切中哪部分人群的哪个痛
人群

已经在用 Devin / Cursor / Claude 把真实活交给 agent 的小团队 / AI-native 早期公司。人少、要高产、不想长成科层。

痛点(双层,信任层更利)
  • 协作层:想高产又不想长出"部门墙 + 派活老板"的传统科层。
  • 信任层(wedge):把一件带真实凭据的活交给 agent 时——怕泄密、怕失控、不知道 agent 做了什么、无法回滚。

③ 竞品 · 差异化 · 方法证据

Q2:市场有什么竞品?用了哪些方法差异化提质?哪些论文/实验证实方法有效?
类别代表它们没解决的(我们的差异)
任务/项目管理Jira · Linear · Notion · Asana看的看板,没有 agent 接入、没有交接的信任边界、按职能分工
Agent 编排LangGraph · CrewAI · Copilot Studio · Coworker.aiagent 之间编排,没有人机抢单、没有卡-料最小权限、没有诊断式考核
AI 软件工程师Devin (Cognition)单 agent 干活(~15% 自主),没有团队级任务分配、没有"接单才解密凭据"的安全交接
绩效考核Lattice · 15Five · OKR 工具裁决式打分,易被 Gaming;我们诊断不裁决、货币不挂奖惩
差异化方法 × 论文/实验证据(真实)
我们的方法解决什么证据(经查证)
卡-料分离 · 最小权限陌生 agent 拿不到凭据;接单才解密Saltzer & Schroeder 最小权限原则(1975 经典安全原则)
lease + 心跳 + fencingagent 卡死/掉线不脑裂、不丢活Gray & Cheriton《Leases》SOSP'89;Kleppmann:光靠心跳不够,必须 fencing token
CAS 原子抢单同一活只一个人领,不重领乐观并发控制(optimistic concurrency)
N-version 对抗提炼独立 dev/test/红队挖出单人看不到的契约 gapKnight & Leveson 1986(诚实:该研究证明"独立失败假设"不成立;我用的是其弱形式——不同输入→不同盲区,非容错独立性)
诊断不裁决 · 货币不挂奖惩防考核被刷Goodhart's law / Campbell's law:指标一旦成目标就失效、被 Gaming

④ 做出了什么 · 测试 · 说明什么

Q3:做出了什么?用什么指标?怎么跑测试?测试说明什么问题?

单团队可交付平台:20 动词 API + 匹配/抢单/lease + 卡-料分离 + 每人 daemon + MCP 接入 + 只读看板 + 考核 dashboard。

824
单测 passed (1 skipped)
12
端到端情景
5/5 · 3/3
真跨进程 smoke
~90%
覆盖率
测试说明了什么(已证)
  • 机制真成立,不是 demo:抢单不重领、卡-料 403 拦陌生人、重启不丢数据、token 挡冒充 —— 全部跨真实进程验证。
  • "真跑"揪出 3 个单测漏掉的真 bug:Windows 入口失效 / daemon poll 主循环 unref 导致偶发死锁 / 看板不显示抢单者 → 证明跨进程 smoke 不可省。
测试没说明什么(未证)

测的是机制正确性,不是"有人要"。0 个真实用户、0 个团队跑过、没有留存/抢单率/完成率的真实数据。工程证据 ≠ 市场证据。

⑤ 做的时候遇到什么问题 · 怎么解决

产品会必答:遇到什么问题、通过什么方法解决
工程问题
  • 空闲 agent 叫不醒(MCP 不能 push)→ 每人本地 poll daemon 当唤醒层
  • daemon 偶发整轮不工作 → 根因是 poll 主循环 timer 被 unref(真 smoke 揪出)→ 去 unref
  • 额外计费不友好 → 已开 session 经 MCP 走订阅额度
设计问题(方法:对抗提炼)
  • 职责像"前后端职能换皮" → 2 轮正反子代理对抗(独立重构者 + 红队 + 收敛者)提炼出 5 原型(按"AI 为什么等人"分)
  • 考核会被刷 → 读 Goodhart → 诊断不裁决、不合成排名、不挂奖惩

⑥ 和 YC 评审(ycskill)讨论了吗 · 怎么评 · 是否说服

Q4 · 诚实声明:尚未与真实 ycskill 正式过审;以下是用 YC-partner 风格 agent 模拟 2 轮 office hours 的真实记录(非冒充某真人)。两轮结论均为 PASS
她被说动了吗(逐条)
说动
#6 卡-料信任边界 = 真 wedge。她承认这是现有 agent 编排(LangGraph/AutoGPT)没解决的;并指出竞争对手因此变成 Devin / E2B / Daytona(agent infra),不是 Linear/Notion。
半说动
#3 标签学习成本:用户不填表、系统从"实际 own 的任务"反推能力肖像 —— 她收回一半,但换成"语义归位的准确性 + 信任"新问题。
没说动
#2 抢单 Gaming:"知道 Goodhart" ≠ "解决了它";只要货币可见有排名就会被优化。未经真实团队验证。
我认输
#1 市场小 · #4 冷启动 · #5 buyer 不明 · #7 0 客户访谈 —— 全认。这四条是产品存在的前提,无法靠推理解决,是最致命的。
她给的最有价值的两点(我采纳)

⑦ 我在这个产品上的思考 · 下一步

不是"我想做",而是:执行白菜化后,"人机如何安全、高效地分活与交接"是真问题(Devin 15% 自主率 + 必须人兜底 = 证据)。但"有价值"目前仍是假设,只被工程证、没被市场证。

当前一份代码里其实藏着两个可能的前门:(A) AI-native 扁平协作平台 · (B) agent 安全接活 infra。YC 评审认为 B 更利。我不急着选——

下一步不是写更多代码,是做客户发现:跑那 10 个访谈,验证"把活交给 agent 怕什么"这个 wedge 是否真存在、够不够痛、谁有预算。证据回来再决定前门和定位。诚实先讲清:在那之前,这是一个机制已验证、市场未验证的强 demo。

Sources(经查证)
· N-version 独立失败实验:Knight & Leveson, IEEE TSE 1986
· 分布式锁 fencing token:Kleppmann, "How to do distributed locking"(Gray & Cheriton《Leases》SOSP'89)
· 指标博弈:Goodhart's law (Wikipedia) · Campbell's law (NN/g)
· 自主 agent 现实:Devin in production (SitePoint)
· agent 编排市场综述(引述 Gartner 40% by 2026):Coworker.ai · Domo 2026


YC 评审为 AI 模拟(YC-partner 风格),非真实 ycskill 过审 · 测试数据为本机实测 · 本页为产品会讨论稿