DEV Community

Cover image for 把思维导图接进 Agent 输入框
冯智勇Geo
冯智勇Geo

Posted on • Originally published at fengzhiyonggeo.com

把思维导图接进 Agent 输入框

核心结论: 将思维导图变成 Agent 的外部编辑器,可以形成“快捷键唤起—结构化编辑—直接发送”的完整输入链路。

为了结构化表达,我做了一个 Agent 外部编辑器。

这个想法来自我使用 OpenMarkdown 时,通过 ctrl+g 切入外部编辑的体验:写到一半时按下快捷键,进入更适合编辑的环境,完成后再回到原来的输入框。我想把类似的体验放进 Agent,让用户不必一直挤在单行或多行输入框里组织复杂问题。

为什么是思维导图

我选择的不是普通文本编辑器,而是树状思维导图。

核心原因有:

  1. 编辑层面:对我来说,拖拽节点比在文档里重新调整层级更高效。
  2. 思考层面:我能同时看到内容的整体结构,更容易发现缺失或错位的分支。
  3. 内容层面:树状结构迫使我在发送前明确哪些是前提、补充和从属关系,而不是把这些关系留给 AI 猜。

在浏览器中整理准备发送给 Agent 的树状内容

如果内容本身的逻辑基本正常,那么经过思维导图整理后,发送给 AI 的文本也会天然带有结构。结构不是提交之后由 AI 猜出来的,而是在输入阶段就已经形成。

小黑把散乱文字整理成树状页面并推向 Agent 输入框,表现先结构化再发送的输入链路

我打通了什么

目前,我在 AI 编程助手 pi 中安装了一个 mindmap-edit 扩展,并把入口绑定到 ctrl+g

按下快捷键后,扩展会读取当前输入框中的文字,写入临时的 prompt.md,再调用 pmind-browser,用 Chrome 打开基于 MindElixir 的思维导图编辑器。

用户可以在导图里拆分、移动和重新组织内容。点击提交后,只要内容不为空,它就会通过 pi.sendUserMessage 自动作为用户消息发送,并清空原输入框;如果取消,输入框仍然保留原来的内容。

至此,一条完整链路已经跑通:

ctrl+g 唤起 → 外部编辑 → 思维导图整理 → 点击提交 → 直接发送给 Agent。

思维导图提交后作为结构化消息发送到 Agent

它解决不了什么

思维导图能让表达形式结构化,但结构化的格式不等于有逻辑的内容。

如果输入本来就是一团没有逻辑的想法,工具最多提供拖拽和分层,不能替用户完成判断。它可以约束表达、提示用户整理,却不能凭空补上因果关系和清晰观点。

当前实现还不够顺滑。从输入框切到浏览器再切回来,会带来摩擦和割裂感。这也让我更确定:真正需要优化的,不是思维导图的编辑能力,而是它进入 Agent 输入框的方式。

最终要消失在输入框里

我理想中的形态,是按下 ctrl+g 后,一个类似 uTools 的悬浮窗口直接出现在当前输入框之上。用户在里面用思维导图编辑,点击一次就提交并发送,AI 随即回答整理后的内容。

外部编辑器虽然叫“外部”,体验上却不应该让人感觉离开了对话。真正值得保留的不是思维导图这个形式,而是它所形成的输入链路:在发送之前给复杂想法一次整理结构的机会,然后无缝交给 Agent。

这个项目还在继续优化。如果后续把交互和稳定性打磨到可以公开使用的程度,我会整理代码和使用说明,并发布到 GitHub。

Top comments (0)