第十篇 · 语音与多模态交流
组合文件、图片与语音
桌上有合同,手机里有现场照片,同事又发来一段语音补充。把它们全丢进 ChatGPT 看似省事,结果模型把照片上的旧编号当成合同里的新编号,还把同事的猜测写成了要求。
多模态任务的难点不是输入更多,而是让每份材料各司其职。
材料也需要自我介绍
上传时给材料一个简短身份:文件 A 是已签版本,用来确认条款;图片 B 是现场现状,只能说明可见情况;语音 C 是同事的补充意见,不覆盖正式文件。编号很朴素,却能阻止很多无意拼接。
然后先让 ChatGPT 复述材料关系,不急着下结论。如果它说“根据照片可以确认合同已执行”,就能立刻发现越界:照片也许只拍到一个设备,无法证明整份合同的状态。
有时材料之间根本没有可靠关联。照片没有拍摄日期,文件也没写设备编号,此时最专业的结果不是勉强配对,而是提出一个很具体的补充请求:“请提供带编号的现场近照。”多模态不该把未知变成连接词。
冲突不能靠语气解决
书面文件