中国の研究チームが手掛けた「OpenCoder」というモデルは、集めるのではなく厳選する方法を採った。コンパイルできない、TODOやFIXMEのコメントが残っている、といった品質の低いコードを捨てていく。フィルタリングなしでは30点程度だったHumanEvalのスコアが、65点まで伸びたという。
中国の研究チームが手掛けた「OpenCoder」というモデルは、集めるのではなく厳選する方法を採った。コンパイルできない、TODOやFIXMEのコメントが残っている、といった品質の低いコードを捨てていく。フィルタリングなしでは30点程度だったHumanEvalのスコアが、65点まで伸びたという。