拍照识别票据、根据会议录音整理任务、从设备图片判断异常,多模态能力让很多原本需要人工转录的环节变短了。真正上线后,团队却常发现模型错误来自输入,而不是推理。
镜头反光遮住编号,录音里多人同时说话,附件名称与正文不一致。人会下意识补齐这些缺口,系统必须明确知道哪里缺了信息。
先检查输入是否足够
模型处理前可以先做质量检查:图片是否清晰、必要页面是否齐全、音频是否可辨认。缺少关键材料时,直接要求补充,比继续生成不确定结论更省时间。
上传界面也应告诉用户需要什么。与其写“请上传资料”,不如说明文件类型、拍摄角度和必须出现的字段。
多模态能力的上限,常被输入环节最普通的小问题压住。
保留不同信息的关系
一组图片的先后顺序、录音中的说话人、表格与附件的对应关系,都属于业务上下文。把所有内容拆成孤立片段,会让模型看到信息却无法理解关系。
系统应保存时间、来源和对象标识,让结果能够回到原材料核验。用户点击结论时,最好能看到它依据的是哪张图、哪一段声音。
把不确定交给合适的人
低风险任务可以自动完成,高风险判断需要人工确认。确认页面应突出模型拿不准的部分,避免让审核者重新阅读全部材料。
使用者的修正还要回到输入流程。如果某类照片经常无法识别,先改拍摄指引可能比反复调整提示词有效。多模态工作流成熟以后,输入设计和模型能力会一起被维护。
