Skip to content

图像与视觉

xopc 可以理解聊天中附加的图片;配置兼容模型和凭据后,也可以生成新图片。

理解图片

  1. 打开聊天并附加受支持图片。
  2. 提出具体问题,例如“提取这张收据的合计”或“指出这个界面的布局问题”。
  3. 对照原图检查回答,尤其是小字、数字和安全关键细节。

当前聊天模型可能直接处理图片,xopc 也可能使用单独的视觉模型。两者都没有配置时,Agent 会报告无法使用图像理解。

配置图像生成

  1. 打开 设置 → 能力 → 图像
  2. 选择服务商和生成模型。
  3. 添加页面要求的凭据。
  4. 把模型分配给目标 Agent。
  5. 生成一张小型测试图片。

终端中使用 xopc image statusxopc image providers 查看可用性。

生成或编辑

描述主体、构图、风格、宽高比和必须排除的内容。编辑图片时,附加原图,并明确哪些内容需要改变、哪些必须保持不变。编辑能力取决于服务商和模型。

生成文件会保存在配置的工作区或媒体输出位置。用于其它应用前先确认文件位置。

隐私与准确性

  • 发送给云端模型的图片按该服务商政策处理。
  • 上传前删除敏感元数据,并裁掉无关私人内容。
  • 不要只依赖视觉输出作身份、法律、财务或医疗决定。
  • 手动核对文字、尺寸和数量。
  • 生成商标、版权内容或真人形象前检查服务商条款。

故障排查

  • 附件被拒绝:检查格式和大小限制。
  • Agent 看不到图片:选择支持视觉的模型并新建 Session。
  • 无法生成:配置图像服务商并为 Agent 分配模型。
  • 编辑变成重新生成:所选模型可能不支持图片编辑。
  • 找不到输出:检查 Agent 工作区和 Gateway 日志。

基于 MIT 许可证发布