Towards Data Science

A Day in the Life of a Data Scientist in 2026

8.5内容质量

TL;DR · AI 摘要

AI显著改变了数据科学家的日常工作,提示工程成为核心技能,LLM成本控制成为关键挑战。

核心要点

  • 精确设计提示词可使LLM输出质量提升数倍,需包含具体指标和约束条件。
  • Claude等AI工具使项目协作效率提升40%,减少人工调试时间。
  • 通过token优化和模型选择,LLM分析成本可降低60%以上。

结构提纲

按章节快速跳转。

  1. 对比2024与2026年数据科学家工作方式的颠覆性变化。

  2. 现代数据科学家50%时间用于优化AI提示词设计。

  3. LLM成本控制

    通过token压缩和模型选择降低60%分析成本。

  4. Claude等AI助手使项目协作效率提升40%。

  5. 自动化提示生成工具将减少30%人工优化工作。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 2026年数据科学家工作流程
    • 提示工程
      • 精确指标要求
      • 多版本测试
    • LLM成本控制
      • token优化
      • 模型选择
    • AI工具应用
      • Claude协作
      • 自动化分析

金句 / Highlights

值得收藏与分享的关键句。

#数据科学#AI#提示工程#LLM
打开原文

2026年数据科学家的一天 | Towards Data Science

数据科学

2026年数据科学家的一天

人工智能如何彻底改变我的日常工作流程

Haden Pelletier

2026年8月14日

5分钟阅读

分享

照片由Ofspace LLC在Unsplash上提供

两年前,我的日常工作完全不同

令人惊讶的是,两年前我仍然每天编写和调试代码。逐行进行。调试两小时仍无进展后,几乎要把头撞到桌子上。我知道,这听起来有点疯狂,对吧?

我以前的典型工作日:

  • 从头开始编写(并调试)每个SQL查询和Python脚本
  • 逐条构建幻灯片演示文稿
  • 编写没人会阅读的文档,直到出现问题(即使这样,他们也几乎不会阅读)

我在2024年写过关于数据科学家日常工作的文章。而现在,我实际的周二工作日几乎完全不一样了。

我不会假装这完全是好事。有些日子感觉我的工作没有变得更轻松,反而悄悄变成了另一种工作。我必须在仍在做旧工作的同时,临时学习新工作。

(是的,我知道现在仍然有很多数据科学家在做我两年前做的很多事情,但这也是我的经历,以及我认识的许多数据科学家的共同经历。)

提示工程已成为工作的重要组成部分

作者使用Claude生成的图像

是的,2024年我们已经有了ChatGPT,也进行了提示工程。但当时我并不喜欢使用ChatGPT,因为它经常让我感到沮丧。在向ChatGPT提供代码之前,我需要花更多时间解释背景信息,即使这样,它似乎仍然难以找到错误。

随着Claude等AI的进展,这种态度发生了很大变化。项目和技能等特性使得与已经了解背景和历史的AI讨论项目变得容易得多。

因此,我现在的工作日中有相当一部分时间用于编写和优化提示。早期我的提示很随意,比如:

总结该模型的预测准确性。

这通常只会得到一段模糊的描述,往往不包含你真正想要的洞察。现在我会编写更精确的提示,例如:

总结该模型过去14天的预测准确性。报告每天的确切MAPE和RMSE,标记任何MAPE超过5%的日期,并说明趋势是每周改善还是恶化。不要对误差指标进行四舍五入,保留两位小数。

输出质量的差异是巨大的,说实话,现在这已成为我必须主动加强的一项技能。

目前我常规工作流程中包含的几个要素:

  • 仔细检查大语言模型(LLM)的输出结果
  • 对相同任务测试不同提示变体,并并排比较输出结果
  • 直接在提示中写入约束条件(单位、小数精度、不应猜测的内容),而不是在生成结果后再进行修正
  • 在训练机器学习模型之前进行特征选择,只保留有意义的特征,避免塞入数百个随机特征导致过拟合或过多噪声。

这些原则与大语言模型(LLMs)的实践高度契合。并非所有任务都需要使用最大、最昂贵的模型。对支持工单进行分类或从文档中提取日期,不需要与总结40页合同相同的计算能力。将简单任务路由到更小、更便宜的模型,而将昂贵的模型保留给真正需要其能力的任务,从而将成本转化为实际的杠杆。

以下是一些我如何控制成本的具体实践:

  • 通过数据清洗减少输入规模(例如,从邮件链中移除链接、图片和其他与模型无关的字符)
  • 通过缓存重复调用而非对相同输入重复运行相同提示
  • 在适当场景使用传统机器学习而非对所有任务都使用大语言模型
  • 跟踪每个任务的令牌消耗量
  • 研究减少令牌使用量的最佳实践

利益相关者沟通与演示

照片由Campaign Creators在Unsplash提供

大量节省的时间往往被消耗在会议、幻灯片制作以及将模型结果转化为非技术人员可采取行动的内容上。

我过去需要花费数小时从零开始制作演示文稿。现在我可以在几分钟内生成一个面向利益相关者的仪表板草稿或幻灯片大纲,听起来似乎应该能腾出我的下午时间。但实际上,我只会将这些节省的时间用于更多会议,向人们解释模型发现了什么以及为什么重要,因为响应速度足够快,利益相关者现在期望更频繁的进度检查。

真正重要的技能并没有改变:将技术上正确的内容转化为产品经理或高管可以据此做决策的信息。AI可以起草幻灯片,但它无法决定幻灯片的核心观点(这仍然是我的职责)。

结论

即使有了所有这些工具,我的工作本质仍然大部分保持不变。我仍然需要开会并与团队成员协作。我仍然需要决定哪些内容值得建模。我仍然需要发现AI生成的摘要中自信陈述的错误信息。我仍然需要熟悉领域知识,以察觉数字看起来略微错误而非明显错误。在必要时,我仍然需要使用传统机器学习方法。

如果说有什么变化,那就是判断力现在比以往更重要,而非更少,因为这是唯一从未被自动化的领域。

2026年的我的工作日并不比2024年更短,只是形式发生了变化。机械性工作的时间减少,用于深入思考业务问题的时间增加。

感谢阅读

  • 我使用AI构建了一个30天社交媒体内容日历生成器:点击此处获取
  • 在LinkedIn上关注我
  • 买我一杯咖啡支持我的工作!

撰写者

查看Haden Pelletier的所有文章

职业发展

数据科学家

LLM

生产力

提示工程

分享本文

  • 在Facebook上分享
  • 在LinkedIn上分享
  • 在X上分享

Towards Data Science是一份社区出版物。提交你的见解以触达全球受众,并通过TDS作者支付计划获得报酬。

更新为你的实际投稿链接

为TDS撰写文章

✦ 结束CTA ✦