前言
短网址已经是一个老生常谈的话题了,我们的链接常常会因为需要携带各式各样的参数,或者随着业务增长,变得越来越长。对于用户而言,过长的链接体验必然是不好的,短网址也由此而生。其原理大致便是,通过将原链接和短链接一一对应,在用户访问短链接后,重定向到原链接。短链接主要有几个作用:
- 缩短原链接长度,便于营销推广
- 数据统计,在重定向的过程中进行PV、UV等数据统计
- 屏蔽原链接域名
短链接生成算法
短网址一般包含的字符是a-z,A-Z,0-9
,共62个字符
自增序列算法
- 设置一个10进制的自增变量
x
,生成短链接时将其转换为62进制的数值,该数值便作为短链接,下次生成短链接则x+1
。该算法运用了低进制转高进制,字符数会变少的原理。
例如:当前10进制自增变量值为20190519
,转换为62进制后,值为BNBU3
哈希算法
MD5消息摘要算法
(英语:MD5 Message-Digest Algorithm),一种被广泛使用的密码散列函数用于确保信息传输完整一致。MD5 加密后的位数一般为两种,16 位与32 位,这里我们使用32位。
- 先将长链接通过md5加密为32位字符串,分为4段,每段8个字节
- 对这四段循环处理, 取 8 个字节, 将他看成 16 进制串与 0x3fffffff(30位1) 与操作, 即超过 30 位的忽略处理
- 每次这
30
位的尾部6
位 与16进制的3D
进行&
运算,得到一个小于3D
的数值(16进制的3D
对应10进制的61
),再到字符表[a-zA-Z0-9]中取到对应的字符。将这30
位进行右移5位的操作,再次进行第三步,最终将得到一个长度为6的字符串。其中为什么是61
而不是62
呢?因为获取字符串时下标从0
开始。 - 总共能得到4段长度为6的字符串,任取其一即可
优缺点
- 自增序列算法的优点是简单易理解,而且永不重复。但是该算法存在安全问题,容易被爬取数据。开源的
yourls
使用的就是这种算法。 - 哈希算法得到的短链接长度固定,但是存在重复的可能性。
参考:
https://hufangyun.com/2017/short-url/
https://blog.csdn.net/is_zhoufeng/article/details/26503725