图像与视觉
xopc 可以理解聊天中附加的图片;配置兼容模型和凭据后,也可以生成新图片。
理解图片
- 打开聊天并附加受支持图片。
- 提出具体问题,例如“提取这张收据的合计”或“指出这个界面的布局问题”。
- 对照原图检查回答,尤其是小字、数字和安全关键细节。
当前聊天模型可能直接处理图片,xopc 也可能使用单独的视觉模型。两者都没有配置时,Agent 会报告无法使用图像理解。
配置图像生成
- 打开 设置 → 能力 → 图像。
- 选择服务商和生成模型。
- 添加页面要求的凭据。
- 把模型分配给目标 Agent。
- 生成一张小型测试图片。
终端中使用 xopc image status 和 xopc image providers 查看可用性。
生成或编辑
描述主体、构图、风格、宽高比和必须排除的内容。编辑图片时,附加原图,并明确哪些内容需要改变、哪些必须保持不变。编辑能力取决于服务商和模型。
生成文件会保存在配置的工作区或媒体输出位置。用于其它应用前先确认文件位置。
隐私与准确性
- 发送给云端模型的图片按该服务商政策处理。
- 上传前删除敏感元数据,并裁掉无关私人内容。
- 不要只依赖视觉输出作身份、法律、财务或医疗决定。
- 手动核对文字、尺寸和数量。
- 生成商标、版权内容或真人形象前检查服务商条款。
故障排查
- 附件被拒绝:检查格式和大小限制。
- Agent 看不到图片:选择支持视觉的模型并新建 Session。
- 无法生成:配置图像服务商并为 Agent 分配模型。
- 编辑变成重新生成:所选模型可能不支持图片编辑。
- 找不到输出:检查 Agent 工作区和 Gateway 日志。