图博数智
AI化工

日化配方数据怎么整理才能用3类数据1个底座

· 图老师

日化配方数据怎么整理才能用?3类数据1个底座

最近跟几家日化企业聊AI落地,发现一个共同现象。

聊到AI能干什么,大家兴致都高。

聊到第一步干什么,气氛就静了。

因为第一步绕不开一件事,把配方数据整理出来

而这恰恰是大多数日化企业最头大的环节,数据散在四方,谁都说不出全貌。

今天图老师把这件事拆开讲,日化研发的数据就三类,每类的乱法不一样,治理的路子也不一样,最后合成一个底座。

图博数智日化配方AI方案架构

先说整理的总体原则,一句话,别追求一步到位

数据整理是持续工程,第一遍的目标是能查,第二遍才是好用,第三遍是越用越准。

想着一次整理到完美的企业,多半停在第一步。

接受不完美、边用边补的,反而三个月就有产出。

下面分类讲,每类数据怎么落到能查。

第一类配方数据乱在版本

第一类,配方本体数据,配比、原料、工艺参数。

这类数据的价值最高,乱得也最有特点。

乱在版本。

一个成熟配方迭代十几版是常态,改个增稠剂调个香精量都算一版。

这些版本散在共享盘、邮件附件、老师傅电脑里,文件名靠后缀区分,v2final、v2final新、v2最终版,懂的都懂。

乱在命名。

同一个原料,采购叫商品名,研发叫INCI名,配方师之间还有行话简称,一个东西三四个叫法,统计都统计不准。

整理配方数据,干三件事。

归集,所有版本收进一个库,先求全再求精。

定名,原料命名统一,一个原料一个标准名,其他叫法挂别名。

版本链,每个配方挂上版本历史,哪版生效、哪版废弃、为什么改,链式记录。

整理完的标志是,随便说一个产品,两分钟调出它现在生效的配方和全部历史版本

第二类实验数据乱在分散

第二类,实验和打样数据,测试结果、稳定性记录、感官评价。

这类数据的乱法和配方不同,乱在分散。

仪器导出的测试数据在检测电脑里。

打样记录在实验记录本上,手写的。

稳定性跟踪在Excel里,谁跟的项目谁管。

感官评价在群里,一段段语音和文字。

分散的结果就是查不过来。

想回答这个体系半年前做过哪些尝试,除了问当事工程师,没有第二条路。

整理实验数据,也干三件事。

转录,手写记录和截图数据录入结构化表格。

关联,每条实验记录挂上对应配方版本,实验跟配方对得上号。

补全,关键条件缺的补上,补不上的标注。

南京大学的课题组给MatSeek建数据底座时走的就是这条路,文献、实验数据、组内记录统一结构化,检索精准度做到95%以上

企业配方数据的治理,逻辑完全同构。

第三类文献标准数据乱在庞杂

第三类,文献和标准数据,国标行标、技术论文、原料供应商资料。

这类数据的乱法是庞杂。

行业标准一堆,国内的国际的,隔几年修订一轮。

供应商的技术资料每家一套格式,COA、TDS、MSDS,文件格式五花八门。

技术文献就更不用说了,量无限大。

这类数据单条看着都有用,堆在一起就成了找不到的宝藏。

整理这类数据,重点是结构化。

标准条款拆成可检索的条目,什么原料限多少量,适用什么产品类别。

供应商资料按原料归档,一个原料挂全部供应商文件。

文献按体系打标签,要查某个体系,相关文献一起调出。

整理完的标志是,研发问一个合规问题,三分钟内给出标准原文出处。

图博数智配方详情界面

三类数据合成一个底座

三类数据各自整理好,最后一步是合成。

合成不是拷到一个文件夹,是打通关系

配方关联实验,每个配方版本挂上它的打样记录和测试结果。

配方关联原料,每个原料挂上它的供应商资料和历史批次。

原料关联标准,每个原料挂上它受约束的法规条款。

关系打通之后,问一个综合问题,三类数据一起出面。

这个产品的现行配方是什么,历史稳定性表现如何,原料有没有合规风险,一次答全。

这就是知识底座,AI配方能力的全部地基。

检索、推荐、预判、合规检查,所有AI能力都跑在这个底座上。

底座的厚度,决定AI能力的天花板。

图博数智给日化客户做落地,第一步永远是帮着建这个底座,inFab知识库平台就是干这个的。

inFab是国内首家依托业务本体建模的产业级AI知识库平台,配方、实验、标准三类数据入库后,名词统一、关系打通、检索带溯源,这一整套正是它的主场。

FDE团队进场先贴着你们的业务把原料命名和配伍规则理清楚,这个苦活inFab接得住,理得越细,后面AI的能力越稳。

三类数据合成的底座建在inFab上,数据归企业,平台私有化部署在内网。

整理过程中的三个坑

数据整理听着机械,坑不少,图老师提前给你标出来。

坑一,追求完美。

想着把所有历史数据全整理完美再开始,三个月过去还没入库。

正确姿势是先跑框架,代表性数据先入,边用边补。

坑二,只整理不关联。

数据入了库但关系没建,配方是配方实验是实验,查起来还是两套系统。

关系打通才是底座,不然只是个网盘。

坑三,没有维护机制。

一次性整理完就不管了,三个月后新数据又散落各方,回到原点。

定一条规矩,新数据产生即入库,谁产生谁负责。

整理从哪开始

三类数据一起动手,必然烂尾。

图老师给的顺序是,配方数据先行。

原因两个。

一是配方数据是核心资产,价值密度最高,先整理先受益。

二是配方数据量相对可控,一个季度能见成效,团队有正反馈。

实验数据第二步,文献标准第三步,穿插着做。

启动的成本也没那么吓人。

最后给个心理预期。

整理这件事,第一遍最累,第二遍减半,第三遍开始变成习惯。

按模板记录的新数据,入库成本几乎为零,累的只是回填历史。

熬过头三个月,后面是顺水推舟。

先从最近两年的新配方开始规范录入,新数据不欠账,历史数据逐步回填。

最后算一笔时间账。

配方数据先行,一个季度。

三类全通,加维护习惯养成,半年到一年。

听起来不短,但这个底座是资产,建一次用十年,摊到每年,成本可忽略。

判断标准一句话:三类数据不用一次理完,但关系框架要一次搭对,框架对了,往后每条新数据自动归位。

一句结论可以单独记下:日化AI落地的第一步不是选模型,是把三类数据理成一个底座,数据理顺了,AI的能力是水到渠成的事。


关注我,图老师每天分享一个企业AI落地的真问题、真办法。

先进团队正在用的 AI 落地方案

判断您的业务里哪些环节已经适合用 AI 替代?