ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Harmony Intelligence AI 开放能力深度解读 | 图像超分 + 文搜图:端侧视觉的“放大镜“与“搜索引擎“

Harmony Intelligence AI 开放能力深度解读 | 图像超分 + 文搜图:端侧视觉的“放大镜“与“搜索引擎“ HarmonyOS 7.0.0API 26· Core Vision Kit 端侧视觉 AI 新能力开篇当系统级能力变成几行代码HarmonyOS 7.0.0API 26的 Core Vision Kit 悄悄补上了两块原本属于重投入的端侧视觉拼图图像超分Image Super-Resolution与文搜图Text-to-Image Search。前者把一张低清图在端侧重建为 4 倍高清后者让你用一句海边日落从本地相册里捞出对应照片——两者最大的共同点是推理跑在设备 NPU 上图片与文本数据全程不出设备。这些能力正在把造奇迹的门槛削平。在 HDC 2026 极客赛决赛里20 支团队借助 HarmonyOS 7API 26的空间计算、端侧 AI 等系统级能力在 36 小时内完成极限编码。参赛者里有工艺美院的学生、师范专业的大一新生也有独立开发者——当底层模型被收进import { ... } from kit.CoreVisionKit这样的几行代码写奇迹的人就不再是只有大厂的算法团队。上期我们拆解了 Core Vision Kit 的人脸检测与通用文字识别能力看清了端侧智能感知如何看得清脸、认得出字。本期把镜头拉到更日常的两件事上让模糊的图变清晰让找不到的图被一句话唤出。一、两种新能力到底是什么1.1 图像超分端侧 4 倍高清重建图像超分Image Super-Resolution不是放大而是重建。传统插值把周围像素取平均像素变多了、信息没变多所以放大后发虚端侧超分用的是系统预置的视觉模型模型在海量清晰图—模糊图配对上训练过它做的是基于上下文预测并补全合理细节——边缘被锐化、纹理被还原、压缩噪点被压住。API 26 里它把输入图的像素同步放大 4 倍整条链路在设备内完成。它的关键边界很清晰归属kit.CoreVisionKit下的imageSuperResolution分析器Analyzer模式。起始版本26.0.0HarmonyOS 7 / API 26仅 Stage 模型。设备Phone / PC·2in1 / Tablet。倍率固定 4 倍不可配置输入原图最大 2048×2048超限需先等比缩放。运行位置端侧 NPU/XPU 异构推理图片不出设备。1.2 文搜图自然语言检索本地图片文搜图Text-to-Image Search解决的是找图这件事。传统相册搜索是文本对文本——搜文件名、搜手动备注没打过标签的照片等于不存在。文搜图是文本对图像的跨模态检索端侧模型把每张图编码成一个语义向量把你说的一句话也编码进同一语义空间两个向量算相似度语义越接近分越高。所以海边日落不需要出现在任何文件名里只要画面里真有海边和日落就能被捞出来。它的能力规格如下归属kit.CoreVisionKit下的textSearchImage。起始版本26.0.0仅 Stage 模型支持 Phone / Tablet / PC·2in1。区域仅适用于中国境内香港特别行政区、澳门特别行政区、中国台湾除外。输入约束imagePath为沙箱绝对路径不带file://长度 1–128scope作用域仅字母/数字、长度 1–32query查询词长度 1–100不支持纯数字与纯字母支持中文topKey返回上限 0–100默认 100。返回ImageObject数组含imagePath沙箱路径、scope作用域、similarity相似度范围 [-1, 1]越大越相似。二、能用在哪典型场景图像超分覆盖一切图不够清晰的现场老照片修复低清扫描件、旧手机拍的合影一键补出细节。电商素材放大后台存缩略图、前端超分看大图用查看时算力换存储空间。截图 / 文档增强聊天截图、PPT 截图放大后文字边缘依旧利落。证件照放大小图放大用于打印预览省去重新拍摄。压缩存、超分看传输只走低清图显示端 4 倍重建弱网也顺滑。文搜图覆盖一切图找不到的现场智慧相册“去年海边日落的那张”“猫趴在窗台”一句话定位。聊天 / 社交检索对话里以图搜图按语义召回相关图片。电商以文搜图用描述词从商品图库里挑图无需提前标注。私密 / 本地图库数据不出设备敏感图也能语义检索。素材库管理设计稿、截图按内容分组scope过滤零标注可检索。三、行业普遍痛点模糊的图救不回找不到的图捞不出开发者自研或接入传统方案时常被两件事卡住图像超分侧云端超分有延迟、有隐私、有成本上传原图到服务器再下高清弱网卡顿、流量消耗、敏感图出设备。传统插值只是放大不是增强平均像素越放越糊文字边缘发虚。自研模型门槛高算法团队、训练数据、端侧功耗与多机型适配都是重投入。文搜图侧靠文件名 / 标签检索语义理解弱没打过标签的照片等于隐身“橘猫窗台搜不出cat_window.jpg”。云端搜索隐私风险高把整座相册上传做特征提取触碰隐私红线降低用户信任。无标签图不可检索随手拍、截图、未分类素材传统方案基本束手无策。共性痛点端侧算力不足、模型体积大、接入链路长——这三点把视觉 AI 锁在了大厂机房里。四、端侧一站式方案本地闭环两个能力各自成环图像超分端侧 NPU/XPU 异构推理不依赖云端。系统负责三件核心事——边缘增强锐化物体轮廓、文字边界、线条。纹理补全依据上下文重建产品表面、建筑线条、照片细节。降噪压制压缩图常见的块效应与模糊噪点。开发者要做的只是把图转成 PixelMap交给分析器create → process → destroy三段式即可。文搜图端侧建索引 自然语言查询全程闭环。建索引insertImage把沙箱图片写入端侧特征库按scope分组。自然语言查询search接收一句中文描述返回按相似度降序的命中列表。作用域过滤同一句话可在不同scope如album/pet/work里分别检索互不串扰。注意超分本质是模型在猜——它可能猜错。商品图上模糊的一行小字超分后可能变成清晰但错误的字。因此它适合提升观感不建议用于身份证件、证据类强真实细节场景。五、三大差异化优势打通行业瓶颈隐私安全可控超分与文搜图全流程在端侧执行图片、文本数据不出设备从源头规避泄露风险适配私密相册、个人证件、办公票据等高敏感业务。极简开发接入开发者无需自研算法、训练模型、做端侧功耗与机型适配直接调用系统 AI 能力开发周期与运维成本同步压缩。实时离线可用本地 NPU 推理无云端排队、无网络延迟、无额外流量弱网甚至飞行模式下照样可用。六、双向价值开发者轻松构建消费者体验跃升对开发者降本增效快速复用直接接入成熟系统级模型省去算法自研、训练、调参、设备适配。稳健兼容系统模型经多终端、多场景打磨识别/检索准确率与容错有保障。轻量低耗端侧算力调度执行不占云端服务器与带宽运营成本可控。对消费者体验升级极速响应本地实时处理即拍即超分、即说即找图无卡顿。随手可用不用刻意摆正角度、不用先打标签随手拍的图也能被检索、被增强。内容可复用超分结果可保存分享检索结果可一键打开、复制、转发。七、开发接入指引以下为 API 26 调用范式示意类型与方法名对齐官方文档点击可查看完整指南图像超分 开发指南https://developer.huawei.com/consumer/cn/doc/harmonyos-guides/core-vision-image-super-resolution图像超分 API 参考https://developer.huawei.com/consumer/cn/doc/harmonyos-references/core-vision-image-super-resolution-api文搜图 API 参考https://developer.huawei.com/consumer/cn/doc/harmonyos-references/core-vision-text-search-image-api7.1 图像超分ArkTSimport{imageSuperResolution,visionBase}fromkit.CoreVisionKit;import{image}fromkit.ImageKit;import{fileIo}fromkit.CoreFileKit;// 1. 创建图像超分分析器建议在页面创建时调用一次可页面内复用constanalyzer:imageSuperResolution.ImageSRAnalyzerawaitimageSuperResolution.ImageSRAnalyzer.create();// 2. 将本地图片解码为 RGBA_8888 的 PixelMapconstfileawaitfileIo.open(path,fileIo.OpenMode.READ_ONLY);constimageSourceimage.createImageSource(file.fd);constinputPixelMapawaitimageSource.createPixelMap({desiredPixelFormat:image.PixelMapFormat.RGBA_8888,});// 3. 组装请求图片先包成 visionBase.ImageData再放进 RequestconstimageData:visionBase.ImageData{pixelMap:inputPixelMap};constrequest:visionBase.Request{inputData:imageData};// 4. 执行端侧超分返回像素同步放大 4 倍的结果constresponse:imageSuperResolution.ISPResponseawaitanalyzer.process(request);constoutputPixelMap:image.PixelMapresponse.pixelMap;// 直接交给 Image 组件显示或保存// 5. 用完释放分析器页面退出或不再使用时调用避免常驻内存awaitanalyzer.destroy();7.2 文搜图ArkTSimport{textSearchImage}fromkit.CoreVisionKit;// 1. 初始化端侧检索服务返回 true 表示就绪constok:booleanawaittextSearchImage.init();if(!ok){// 初始化失败检查设备型号、系统版本与区域支持仅中国境内可用}// 2. 把沙箱图片写入端侧特征库scope 为分组标识仅字母/数字长度 1-32awaittextSearchImage.insertImage(sandboxImagePath,album);// 3. 用自然语言检索返回按相似度降序的命中列表consthits:textSearchImage.ImageObject[]awaittextSearchImage.search(海边日落,album,10);// hits[].imagePath 沙箱路径// hits[].similarity 图文相似度范围 [-1, 1]越大越相似// hits[].scope 插入时写入的作用域// 4. 能力更新或不再使用时释放服务awaittextSearchImage.release();八、下期预告Harmony Intelligence AI 开放能力深度解读下一期我们将继续拆解 Core Vision Kit 与更多 Harmony Intelligence 系统级能力把端侧 AI 还能做什么讲透。敬请期待。本文为原创技术解读聚焦 HarmonyOS 7.0.0API 26Core Vision Kit 端侧视觉新能力代码示例为调用范式示意实际接口以华为官方文档为准。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进