GLM 智谱AI ChatGLM 大模型实践AI GLM踩坑记录团队本来在用一些国外模型,但有两个问题绕不开: 1. **中文表达总有点"翻译腔"**,特别是写产品文案、用户沟通这种场景,模型说出来的话不够… 醉月思📁 技术实践📅 2024-11-20
DeepSeekCoder 代码模型 推理优化AI DeepSeek Coder:这次怎么落地的先复现,再谈优化。 先说说我这个项目的具体需求: 1. **本地运行**:不能依赖外部 AP… 醉月思📁 技术实践📅 2024-11-09
llm-training distributed-training data-parallel tensor-parallel pipeline-parallel从数据并行走到模型并进:大模型训练加速技术笔记大语言模型(LLM)的训练需要庞大的计算资源和时间成本。 醉月思📁 技术实践📅 2024-11-06
Yi 01模型 零一万物AI Yi踩坑记录但最近几个项目里,我确实需要找一批能稳定用的中文模型来实际跑业务——GPT-4 固然好,但价格和延迟摆在那里;国产模型选择不少,但稳定性和文档友… 醉月思📁 技术实践📅 2024-11-05
Transformer Attention BERTAI_Transformer实践笔记在我的实际项目中,具体遇到了这些问题: 1. **长文档分类**:需要对500-1000字的技术文档进行分类,RNN经常记不住文档的主题 2.… 醉月思📁 技术实践📅 2024-10-27
注意力机制 Attention Transformer从全局走到重点:AI注意力机制笔记测试时我们发现:当关键信息出现在 token 序列的前 20% 时,准确率会比出现在后 20% 低 15 个百分点。 醉月思📁 技术实践📅 2024-10-23