AI 情绪日记 iOS App — 用 Vibe Coding 从零独立交付一款完整产品




一句话:选一张图定氛围、语音碎碎念替代键盘、多模态大模型理解图+音,生成沉浸式诗意日记。
差异化:AI 不是让你更快,而是让你的情绪有出口。行业追逐效率时,Reverie 做体验。
UI层: SwiftUI (骨架) + WKWebView (如梦似幻的 WebGL 视觉)
存储层: SwiftData + @Attribute(.externalStorage) 外置高清图
AI层: 智谱 GLM-4V (多模态理解) + 阿里云 Qwen3-TTS (语音生成)
语音层: 原生 SFSpeech (零延迟本地识别)
引入 WKWebView 跑 WebGL → 性能代价换取"一眼惊艳"的梦境视觉
判断依据:情绪日记的第一印象决定用户是否愿意倾诉
语音识别走本地 SFSpeech,不走云端 → 零延迟上屏的安全感
判断依据:情绪倾诉时 2 秒延迟 = 信任崩塌
高清照片外置存储,数据库只存元数据
判断依据:日记 App 的照片会无限增长,数据库不能被撑爆
锁死 turnCount >= 3,放弃无限闲聊框
判断依据:每次交互 = Token 真金白银,体验和成本必须平衡
AI 效率工具赛道极度拥挤(Copilot/Cursor/Notion AI)。但"AI 作为情绪容器"几乎空白——技术的理性与体验的感性交织,才是差异化壁垒。
中文情感理解 + 诗意表达是核心体验。GLM-4V 中文生成质量更好,成本低一个数量级,且无需翻墙——用户体验的每一毫秒延迟都会破坏情绪沉浸感。
系统女声毫无感情,会瞬间打破"织梦"的沉浸氛围。但接入 Qwen TTS 踩了大坑——AI 助手死磕 REST 接口频繁报错,最终人工翻阅文档发现强制要求 SSE 流式协议。
用千字长文描述"如梦似幻的流体质感"→ AI 输出硬邦邦的玻璃粒子。解法:停止废话,直接喂参考图。多模态 > 千言万语。
从"写 PRD 然后等工程师做"变成"我来 drive AI 写代码,AI 盲区我 override"。PM 成为产品的全栈操盘手——审美判断、技术选型、成本控制、用户共情一肩挑。亲手做过之后,和工程师的对话质量完全不同。
AI 不懂 SSE vs REST 的 API 演进(知识库过时)、不懂"这种 vibe"需要喂图而非文字描述、不懂用户对零延迟的心理安全感需求。这些需要人类判断力的地方,正是 PM 的不可替代性。
每个 trade-off 背后是"用户最在乎什么"的优先级判断。选 WKWebView 不是因为它好用,是因为用户第一眼的惊艳感 > 后台性能数字。PM 的价值在于做对取舍,而不是什么都要。
每一次用户交互 = Token 成本。"包月体验无限"和"系统绝对可控"必须同时成立。定价不是拍脑袋,是从单用户 API 成本倒推 → 叠加平台抽成 → 再加风控熔断。AI PM 必须懂算力经济学。
极易沉迷于"一个人做出一款 App"的虚幻爽感,忘记市场定位和商业可行性。产品经理的第一性原理永远是:解决真问题,并让它活下去。造梦很爽,但要在现实中醒来。
Emily Wu · Side Project Portfolio · 2026