首页 > 文章 > python教程

Pandas分析客户链：提取交付模式方法

时间：2025-08-15 21:57:31 200浏览收藏

珍惜时间，勤奋学习！今天给大家带来《Pandas分析客户链：提取交付顺序模式》，正文内容主要涉及到等等，如果你正在学习文章，或者是对文章有疑问，欢迎大家关注我！后面我会持续更新相关内容的，希望都能帮到正在学习的大家！

使用 Pandas 分析客户链：提取客户交付顺序模式

本文介绍如何使用 Pandas 分析客户交付数据，提取并统计特定客户链的出现频率。通过对数据进行排序、去重和分组聚合，最终得到不同客户链及其出现的次数或比例，帮助你发现潜在的交付模式。

在实际业务场景中，我们经常需要分析客户的购买行为、访问路径或交付顺序等数据，从中发现隐藏的模式和规律。本文将以客户交付数据为例，演示如何使用 Pandas 提取并统计客户链，帮助你更好地理解客户行为。

数据准备

首先，我们需要准备包含交付数据的 Pandas DataFrame。DataFrame 至少包含以下几列：

DateTime: 交付时间
SortieNumber: 批次号
CustomerName: 客户名称
ProductCode: 产品代码

以下是一个示例 DataFrame：

import pandas as pd

data = {'DateTime': ['01/01/2023 09:00:00', '01/01/2023 09:10:00', '01/01/2023 09:15:00',
                     '01/01/2023 12:00:00', '01/01/2023 12:00:10', '01/01/2023 12:15:00',
                     '01/01/2023 15:00:00', '01/01/2023 15:05:10', '01/01/2023 15:15:00',
                     '01/01/2023 15:30:10', '01/01/2023 15:35:15'],
        'SortieNumber': [1, 1, 1, 2, 2, 2, 3, 3, 3, 3, 3],
        'CustomerName': ['Josh', 'Alice', 'Robert', 'Anna', 'Anna', 'Robert', 'Josh', 'Alice', 'Robert', 'Robert', 'Robert'],
        'ProductCode': ['001', '002', '002', '001', '003', '003', '004', '003', '001', '002', '003']}
df = pd.DataFrame(data)

print(df)

数据处理

接下来，我们需要对 DataFrame 进行处理，提取客户链并统计其出现频率。

排序： 首先，按照 SortieNumber 和 DateTime 对 DataFrame 进行排序，确保同一批次内的客户按照交付时间先后顺序排列。
```
df = df.sort_values(by=['SortieNumber', 'DateTime'])
print(df)
```

去重： 移除同一 SortieNumber 下连续重复的 CustomerName。如果在一次批次中，同一客户连续出现多次，我们只保留第一次出现。

df = df.loc[lambda d: d[['SortieNumber', 'CustomerName']].ne(d[['SortieNumber', 'CustomerName']].shift()).any(axis=1)]
# 或者，如果确定同一个 SortieNumber 中，同一个客户不会被其他客户分割，可以使用更简洁的方法：
# df = df.drop_duplicates(['SortieNumber', 'CustomerName'])
print(df)

分组聚合： 按照 SortieNumber 对 DataFrame 进行分组，并将每个批次内的客户名称用 "-" 连接起来，形成客户链。
```
customer_chains = df.groupby('SortieNumber')['CustomerName'].agg('-'.join)
print(customer_chains)
```
统计频率： 使用 value_counts() 函数统计每个客户链出现的次数。
```
chain_counts = customer_chains.value_counts()
print(chain_counts)
```

结果展示

最终，我们可以得到每个客户链及其出现的次数。例如，Josh-Alice-Robert 出现了 2 次，Anna-Robert 出现了 1 次。

如果需要展示客户链出现的比例，可以将 normalize=True 传递给 value_counts() 函数。

chain_proportions = customer_chains.value_counts(normalize=True)
print(chain_proportions)

完整代码

以下是完整的代码示例：

import pandas as pd

data = {'DateTime': ['01/01/2023 09:00:00', '01/01/2023 09:10:00', '01/01/2023 09:15:00',
                     '01/01/2023 12:00:00', '01/01/2023 12:00:10', '01/01/2023 12:15:00',
                     '01/01/2023 15:00:00', '01/01/2023 15:05:10', '01/01/2023 15:15:00',
                     '01/01/2023 15:30:10', '01/01/2023 15:35:15'],
        'SortieNumber': [1, 1, 1, 2, 2, 2, 3, 3, 3, 3, 3],
        'CustomerName': ['Josh', 'Alice', 'Robert', 'Anna', 'Anna', 'Robert', 'Josh', 'Alice', 'Robert', 'Robert', 'Robert'],
        'ProductCode': ['001', '002', '002', '001', '003', '003', '004', '003', '001', '002', '003']}
df = pd.DataFrame(data)

chain_counts = (df.sort_values(by=['SortieNumber', 'DateTime'])
   .loc[lambda d: d[['SortieNumber', 'CustomerName']]
                 .ne(d[['SortieNumber', 'CustomerName']].shift())
                 .any(axis=1)]
   .groupby('SortieNumber')['CustomerName'].agg('-'.join)
   .value_counts()
)

print(chain_counts)

chain_proportions = (df.sort_values(by=['SortieNumber', 'DateTime'])
   .loc[lambda d: d[['SortieNumber', 'CustomerName']]
                 .ne(d[['SortieNumber', 'CustomerName']].shift())
                 .any(axis=1)]
   .groupby('SortieNumber')['CustomerName'].agg('-'.join)
   .value_counts(normalize=True)
)

print(chain_proportions)

总结

通过本文的教程，你学会了如何使用 Pandas 分析客户交付数据，提取客户链并统计其出现频率。这种方法可以应用于各种场景，例如分析用户在网站上的访问路径、分析客户的购买行为等，帮助你发现隐藏的模式和规律，从而更好地理解客户行为，优化业务流程。

注意事项

在实际应用中，你需要根据数据的具体情况调整代码。例如，如果数据中包含缺失值，你需要先处理缺失值。
如果数据量非常大，可以考虑使用更高效的数据处理工具，例如 Spark。
客户链的长度可以根据实际需求进行调整。例如，你可以只提取长度为 2 或 3 的客户链。
需要注意数据隐私，避免泄露客户的敏感信息。

以上就是本文的全部内容了，是否有顺利帮助你解决问题？若是能给你带来学习上的帮助，请大家多多支持golang学习网！更多关于文章的相关知识，也可关注golang学习网公众号。