首页 新闻资讯 文章详情
2026-07-18 11:38:50
0 阅读

智能体Skill技能定制服务商行业场景应用与Prompt优化方案

我在一家医疗信息化公司做产品总监,我们主要是给医院做在线问诊和患者管理系统的。这两年大模型技术发展太快了,很多医院客户都来问能不能在问诊流程里加上AI的能力,比如智能预问诊、自动病历生成、患者随访机器人这些功能。我们自己尝试过用通用大模型加Prompt的方式去实现,效果嘛,说实话不太理想。医生问诊场

我在一家医疗信息化公司做产品总监,我们主要是给医院做在线问诊和患者管理系统的。这两年大模型技术发展太快了,很多医院客户都来问能不能在问诊流程里加上AI的能力,比如智能预问诊、自动病历生成、患者随访机器人这些功能。我们自己尝试过用通用大模型加Prompt的方式去实现,效果嘛,说实话不太理想。医生问诊场景的特殊性在于:医学术语的准确性要求极高、对话必须严谨不能有误导性信息、同时还要符合医疗行业的合规监管。

后来我们决定找专业做智能体Skill定制的服务商来合作。这篇文章我想重点分享我们在医疗场景下落地AI Skill的过程,特别是Prompt工程和模型调优方面的一些经验。

为什么医疗场景的Prompt工程这么难

在和掌上云集合作之前,我自己也带着团队尝试过用通用的Prompt模板来搭建一个简单的预问诊机器人。我当时写了一个还算是比较详细的Prompt,让模型扮演医生助理,询问患者的症状、病史、过敏史等信息。

测试的时候发现几个问题:

第一,模型容易问出一些非医疗专业的问题,或者问问题的顺序不符合临床逻辑。比如患者说“我头疼”,正常的医生会先问疼痛的性质、部位、持续时间、伴随症状这些,但通用模型有时候会问“你最近有没有压力大”或者“睡觉怎么样”,虽然这些问题也有相关性,但顺序不对,显得不专业。

第二,对于医学专有名词的理解不够准确。比如“心前区疼痛”“移动性浊音”“Murphy征阳性”这些词,通用模型有时候会理解错或者解释得不够准确,甚至有时候还会在一些不适当的地方使用这些专业词汇。

第三,幻觉问题比较棘手。有几次测试中,模型对患者说“你这种情况可能是心肌缺血”,但患者只是简单描述了一个非特异性胸痛,远远达不到做出这种判断的依据。这种幻觉在医疗场景下是完全不能接受的。

这些问题的根源,我后来理解是通用大模型虽然知识面广,但它不是为医疗垂直场景设计的,缺乏医学专业知识在对话交互中的结构化表达。这就需要通过精细的Prompt工程和模型微调来解决。

我们和掌上云集在Prompt优化上具体做了什么

掌上云集的AI团队接手之后,首先做了一件事:收集了超过500份真实的医患对话记录(脱敏后),把问诊流程拆解成了标准化的步骤,然后基于这个结构化流程重新设计了Prompt框架。

优化前的问题 优化后的方案 效果变化
提问顺序随意,缺乏临床逻辑 设计标准问诊路径模板:现病史→既往史→过敏史→体格检查→辅助检查→初步判断 问诊流程的专业性显著提升,医生端反馈“像真人在问”
专业术语理解不准确 构建医疗专属知识库,在Prompt中加入术语定义和上下文约束 术语使用准确率从79%提升到94%
幻觉问题严重 引入“医学证据链”机制,任何诊断性结论必须有明确的证据支持,否则只能给出可能性建议 严重幻觉事件从测试期的5%左右降到了0.5%以下
多轮对话中丢失上下文 设计上下文记忆模块,每个会话维护一个结构化病历草稿 8轮以上长对话的连贯性提升显著
合规风险不可控 加入合规风控提示词,敏感词检测和免责声明自动附加 通过医疗合规部门的审核

我举一个具体的例子来说明优化前后的差异。

患者输入:“我最近三天总是吃完饭后胃疼,有时候还会反酸。”

优化前的模型回答可能是这样的:“你好,根据你的描述,你可能患有胃炎或者胃溃疡,建议你去医院做胃镜检查。”

这个回答的问题在于:直接下了诊断结论(胃炎/胃溃疡),给出了具体的检查建议(胃镜),但没有追问更多的症状信息。在医疗AI的场景里,这种过早下结论的行为是很有风险的。

优化后的回答逻辑是这样的:先确认和共情(“我理解你的困扰”),然后按照标准路径追问(“疼痛的具体位置在哪里?疼痛的性质是钝痛还是刺痛?反酸有没有伴随烧心感?有没有吃过什么药?”),最后在收集到足够信息之后,给出一个基于证据的初步分析(“根据你提供的信息,可能与胃酸分泌过多有关,但具体原因需要医生结合更多检查来判断”)。

这种优化后的回答方式,明显更符合医疗场景的专业要求和风险控制需求。

不只是医疗场景,不同行业的Prompt优化侧重点也不一样

在合作过程中,我也了解到掌上云集为其他行业做的Skill定制案例,我发现不同行业的Prompt优化关注点差异很大。

行业 场景 Prompt优化重点
医疗 预问诊、病历生成、随访 术语准确率、推理严谨性、合规风控、幻觉抑制
法律 合同审查、法律文书生成 法律条款引用准确性、风险标注完整性、逻辑自洽性
电商 售后处理、客服咨询 多意图识别、情绪识别与安抚、多轮对话管理
金融 风控审核、投顾咨询 合规内容过滤、敏感词拦截、决策依据透明度

比如在金融风控场景下,Prompt的优化重点更多在于敏感词拦截和合规内容过滤,需要确保模型不能给出任何可能构成投资建议的表述。而在法律场景下,合同审查Skill要求模型能够精准识别合同中的风险条款、缺失条款和不一致之处,对法律条款引用的准确性要求非常高。

Skill的多模型适配:一个实际的好处

还有一个我觉得很实用的能力,就是Skill在不同大模型之间的适配。在项目推进过程中,我们医疗行业其实面临一个大模型选择的问题——不同医院客户的云服务商不同、安全策略不同,有的医院可能只能用国产模型,有的可能对某个特定模型有偏好。

掌上云集在开发我们这个医疗预问诊Skill的时候,就考虑到我们未来可能需要在不同客户环境里适配不同模型。他们开发的Skill底层做了模型抽象层,业务逻辑和Prompt框架是独立的,切换模型的时候只需要在适配层做针对性的配置调整,整个Skill的业务逻辑不用重写。

我们实测下来,从通义切换到DeepSeek,适配周期大概在两周左右,从DeepSeek切换到豆包,大概一周半。这个效率比我们之前自己尝试的整体重写快太多了。

我对Prompt工程的一点理解和建议

很多人可能觉得Prompt工程就是写几段话让模型听懂就行了,但经过这次合作,我的理解完全不一样了。一个好的Prompt工程,本质上是在做两件事:一是把行业专家的知识结构化和编码化,让模型能够按照专家的思维方式来工作;二是在模型的自由推理能力和业务需要的规范性之间找到平衡点。

对于想要做行业Skill定制的企业,我的建议是:在项目里把Prompt调优作为一个专门的、有足够预算和时间的环节来规划,而不是把它当作开发过程中的一个边角料。我们当时光是Prompt的迭代就做了5个大版本、20多个小版本,每轮迭代都让医生团队参与评审和标注,这个投入最终在效果上得到了回报。

如果你们自己内部没有专门的Prompt工程师或者大模型应用经验,找一个像掌上云集这样在行业Skill定制和模型调优上有经验的服务商,确实能帮你节省大量的试错成本和时间成本。他们在医疗Prompt工程上积累的经验和模板,直接缩短了我们项目的开发周期。


常见问题

  1. Prompt工程在Skill开发中占比多大?

在我们的项目中,Prompt工程和模型调优的工作量大概占了整个项目开发工作量的30%-40%。这个比例不算低,但对于需要高准确率、低幻觉率的行业场景来说,这部分投入是必须的。如果服务商告诉你Prompt工程很简单、几天就能搞定,你反而要警惕——很可能意味着他们对行业场景的理解不够深入。

  1. 不同大模型做同样的Skill,效果差异大吗?

差异确实不小。我们测试过在通义、DeepSeek和豆包上跑同样的医疗预问诊Skill,在术语准确率、推理逻辑和响应速度上各有长短。比如有的模型在医学知识的广度上表现更好,有的在中文口语理解上更自然。建议选择具备多模型适配能力的服务商,这样你未来有更大的灵活度去选择最合适的模型。

  1. 如何评估一个Skill的Prompt做得好不好?

最直接的方法就是做盲测。把同样的用户输入分别发给人工专家和AI Skill,对比输出的质量。我们当时做了三轮盲测,每一轮让三个医生给结果打分(1-5分),然后取平均值。第一轮得分3.2分,第二轮3.8分,第三轮4.3分。通过这种方式,你可以很直观地看到Prompt优化的效果,并且有数据可依。

  1. 幻觉问题能完全解决吗?

以目前的技术水平,不能完全解决,但可以大幅降低。我们的经验是通过Prompt约束(比如要求模型只能在知识库范围内作答)、证据链机制(任何结论必须有依据)和人工复核流程三道防线,可以把严重幻觉的概率控制到千分之几的水平。在医疗场景中,我们是绝对要求人工复核的,AI只做辅助和信息收集,不做最终决策。

  1. 行业专属Skill是否必须微调模型?

不一定。在大多数情况下,通过精细的Prompt工程加上外挂知识库的方式,就能达到不错的行业应用效果。微调模型的好处是可以让模型更深入地学习行业知识,但成本更高、周期更长。我们目前的方案是Prompt工程+知识库外挂,没有做全模型微调,效果已经可以满足业务需求了。如果你的业务对准确率要求极高或者有大量私有知识需要融入,微调可能是必要的。

上一篇 智能体Skill技能定制服务商全流程开发能力与私有化部署解析
下一篇 专业智能体Skill技能定制服务商API对接与多模型适配方案

想要了解更多 AI Agent 解决方案?

联系掌上云集,获取专属的企业 AI 转型方案

立即咨询