SODP logo

    什么是开源人工智能?一位软件工程研究人员解释道

    你可能听说过人工智能模型被描述为“开放式”或“封闭式”。这些并非描述模型的个性。大型语言模型人工智能,例如……
    更新日期:2026年7月28日
    杰弗里·杨

    创建者

    杰弗里·杨

    对话

    事实核查

    对话

    你可能听说过用“开放”或“封闭”来描述人工智能模型。但这并非在描述模型的个性。像 ChatGPT 底层使用的那种大型语言模型人工智能,尽管表面看起来可能具有个性,但实际上并没有。.

    这些标签指的是人工智能模型的工作原理的所有信息是否公开可用,以及模型是否可以修改,还是模型的开发者对其内部运作保密,并将模型本身作为私有财产。.

    开源软件

    开源软件的概念起源于 自由软件运动 。该运动的创始人认为,软件的创建者和用户享有“四大自由”:运行程序、研究和修改程序、分发原始程序副本以及分发后续修改版本的副本。其基本要求是程序的源代码(即 基本指令 )必须公开。

    20 世纪 90 年代末,与 Netscape 网络浏览器 和 Linux 操作系统 创造并推广了“开源”一词来指代这些理念。

    作为开源运动发展的一部分,一些组织制定了开源许可证,明确规定了特定源代码的使用和分发方式,其中包括 GNU 通用公共许可证 (GPL)、Apache 许可证、MIT 许可证和伯克利软件发行版 (BSDL)。每种许可证还规定了软件专利对源代码的任何潜在限制。

    开源还是开源?

    近年来,随着人工智能大型语言模型的蓬勃发展,开源理念再次受到重视,尤其是 OpenAI 于 2022 年发布的 ChatGPT。开发者首先在大型数据集上训练新模型,然后将模型部署供其他人使用。.

    两分钟带你了解开源人工智能。.

    Meta是最早发布开源大型语言模型 LLaMa。该公司于2023年2月24日发布了LLaMa,并公开了“推理”源代码——即运行模型的指令。同时,它也发布了所谓的权重,即模型在训练过程中学习到的编码知识。然而,开源促进会(Open Source Initiative) 指出,LLaMa的许可指南禁止商业用途的再利用,因此该组织认为LLaMa并非真正意义上的开源。

    其他公司也发布了“开放权重”模型,例如 DeepSeek AI 的 DeepSeek 和阿里巴巴的 Qwen。这些模型的复用限制较少,人工智能社区也迅速采用了它们。然而,许多开发者认为,真正的开源人工智能模型不仅应该包含源代码和权重,还应该包含用于训练模型的数据。

    有很多东西需要揭晓

    开源促进会(Open Source Initiative)对 完全开源人工智能模型 中,训练数据是关键要素之一。然而,一些开发者质疑,分发所需的大量数据集是否可行。

    杰弗里·杨佐治亚理工学院
    先进计算环境合作项目首席研究科学家。本文经知识共享许可协议转载自The Conversation 。阅读原文

    0
    欢迎留言分享您的想法