为什么要使用您的数据训练人工智能模型

使用自己的数据训练人工智能模型现在比以往任何时候都更容易访问。您不需要成为程序员即可创建一个定制的人工智能系统,该系统可以准确了解您的业务、客户或特定需求的背景。

用通用模型和用你的数据训练的模型之间的差异是巨大的:虽然ChatGPT知道公共信息,但用你的数据训练的模型知道你的政策,你的市场,你的内部流程和你的语言。公司通过实施用自己的数据训练的AI,在运营效率上获得30%到50%的收益。

小型机构、顾问、自由职业者和小型企业现在可以自动化重复性任务、改进客户服务、生成更多相关内容并做出更快的决策 - 所有这些都无需聘请数据科学家。

用于培训人工智能的无代码平台

无代码平台消除了编程的需要。它们提供可视化界面和直观的流程,您可以在其中加载数据、配置基本参数,并在几分钟内拥有功能模型。

谷歌教学机器

Google 的 Teachable Machine 免费且非常适合初学者,您训练模型识别图像、声音或姿势,只需加载模型单独学习的每个类别的 50 到 100 个示例,许多小企业使用它对产品进行分类、检测照片中的缺陷或识别视频中的行为。经过培训,您将获得一个可以集成到任何网站的代码。

微软自动ML

Microsoft Azure AutoML 自动执行选择和调整模型的整个过程。您上传一个带有数据的 CSV 文件,定义要预测哪一列,系统会自动测试数十种算法,返回最佳结果。

拥抱面部空间

Hugging Face对先进AI模型的访问民主化,无需编写代码即可微调(微调)语言和视觉模型,平台提供现成的模板;您只需适应数据并在几分钟内部署。许多人将其用于聊天机器人、文本分类和情感分析。

准备您的培训数据

训练的质量完全取决于数据的质量,糟糕的数据进来,糟糕的预测出来,因此,准备数据是最重要的,往往也是最被忽视的一步。

收集和组织

1起收集你要解决的问题的相关实例,如果你正在训练一个模型将邮件归类为垃圾邮件或合法邮件,收集每种类型的500到1000个实例,如果是产品缺陷检测,至少从不同角度和照明拍摄200个好产品和200个有缺陷的产品。

件(CSV、Excel 或 JSON)中组织您的数据,对于表格数据,每行都是一个示例,每列都是一个特征,对于图像,将它们放在由它们所代表的类命名的子文件夹中。

清洁与平衡

移重复、不完整或明显错误的例子,如果训练一个模型,其中一个类有 900 个例子,另一个类有 100 个例子,它就会学会偏爱多数类,理想情况下,你应该有类似的数量:如果你不能,许多平台提供加权选项或自动增强(少数例子的合成创建)。

标准化格式:所有图像的大小和格式相同,所有文本的编码相同,日期的模式相同。像这些这样的小细节使工作模型和失败模型之间的区别变得不同。

分成套

训(70%)、验证(15%)和测试(15%),始终将您的数据分为三个部分,训练是模型学习的地方,验证调整超参数(设置),测试评估实际性能,没有代码平台会自动执行此操作,但理解概念有助于您评估结果是否有意义。

实践一步一步:从今天开始

1。选择你的问题

非「改善業務」;而是「將客戶評論歸類為正面或負面」或「檢測客戶何時極有可能取消訂閱」。

2。收集示例性数据

100到1000个你想预测的例子之间收集,如果你有数据历史(旧电子邮件、旧照片、记录),就用它,如果你没有,创建:照片产品,向客户索取例子,使用相关的公共数据,质量比数量更重要;200个精心挑选的例子超过2000个随机例子。

3、标准格式排列

For 文本分类:一个有两列的文件(文本,类别) for images:里面类命名的文件夹 for 数字数据:有良好标记列的CSV 检查缺失值,决定是否删除或填充平均值/中位数。

4、选择平台

Google 可教机器(图像/声音)或拥抱脸(文本) 初学者:表格数据:Azure AutoML 或 Google Cloud AutoML 创建免费帐户,阅读快速文档(15 分钟)并试用。

5、加载数据和配置

件(或文件夹)按照平台方式上传,设置目标是哪一列(你想预测什么),让系统处理,大部分平台实时显示进度。

6、评估结果

练(training)后,你得到一个准确率(命中百分比),如果在80%以上,对大多数真实案例都不错,在70%以下,复习一下你的数据:可能存在重复、数据标签错误或不平衡的类。

7、测试与实施

Production中使用模板,平台提供一个URL或代码,你集成到你的网站、app或系统中,早期监控性能:现实世界与训练数据不同,因此意识到问题有助于快速改进。

常见错误以及如何避免它们

训练模型而不陷入常见的陷阱可以节省数周的返工。最大的错误是使用与测试数据混合的锻炼数据:您将测量不反映实际性能的膨胀精度。

另一个经常出现的错误:将相关性与因果关系混淆 如果你的模型预测某一来源姓氏的客户取消更多,并不是因为姓氏导致取消;而是因为其他因素(位置、收入、语言)相关,避免用导致歧视性偏见的数据训练模型。

2022年数据训练的模型,如果用户行为发生变化,可能会在2024年失败,连续监控准确性,每3到6个月用更新的数据进行再训练。

下一步和持续发展

1个模型工作后,展开。添加更多数据,尝试不同的平台,增加复杂性。一个从简单开始的模型可以演变成一个完整的系统,使你40%的操作工作自动化。

考虑针对不同任务培训多种模型。营销机构可能有一种模型来对潜在客户进行排名,另一种模型来生成头条新闻,另一种模型可以更好地预测发布时间。

加入在线社区:拥抱面孔论坛、AI subreddits、YouTube 上的课程。学习他人的经验可以加速您的掌握。大多数资源都是免费且实用的。