Mendukung pembangunan model bahasa besar yang diperlukan untuk pengembangan dan penyetelan mesin terjemahan AI dan AI generatif.

Pengembangan mesin terjemahan AI dan AI generatif,
Diperlukan untuk penyetelan
Membangun Model Bahasa Besar
Kami akan mendukung Anda.

  • Lebih dari 1 juta pasangan
  • Mendukung lebih dari 10 bahasa
  • Rekam jejak pengiriman yang luas
Minta contoh di sini

Mengenai terjemahan AI dan Tanya Jawab
Menyelesaikan masalah pembelajaran mesin Anda!

  • Ingin mengembangkan terjemahan AI yang sangat akurat dan khusus di bidang tertentu

    Mengkhususkan diri di bidang tertentu
    Terjemahan AI presisi tinggi
    Ingin mengembangkan

  • Ingin meningkatkan akurasi chatbot multibahasa

    Chatbot multibahasa
    Akurasi
    ingin menaikkan

  • Ingin memprediksi apa yang akan dikatakan selama percakapan atau sesi tanya jawab

    Selama percakapan dan sesi tanya jawab,
    Saya ingin memprediksi pernyataannya.

  • Mencari korpus paralel yang kompatibel dengan bahasa Asia Tenggara

    Bahasa-bahasa negara-negara Asia Tenggara
    berkorespondensi
    Korpus Terjemahan
    Melihat

  • Ingin membuat glosarium khusus untuk industri atau bidang keahlian Anda

    Berdasarkan industri atau bidang khusus
    khusus
    Lihat glosarium
    Aku ingin membuat

Enam Kekuatan Koden Corporation

  • Lebih dari 40 Tahun Pengalaman

    Lebih dari 40 Tahun Pengalaman

    Sejak tahun 1980-an, kami telah mengembangkan terjemahan mesin,
    Kami memiliki pengalaman luas dalam mengirimkan korpus bilingual kepada perusahaan besar.
    Berkontribusi dalam pemecahan masalah dengan pengalaman dan pengetahuan bertahun-tahun
    Kami menawarkan korporasi multibahasa.

  • Kuat di bidang khusus

    Kuat di bidang khusus

    Pariwisata, perawatan medis, hukum, keuangan, kekayaan intelektual, dan lain-lain.
    Memiliki korpus paralel di berbagai bidang.
    Konferensi pers, sesi tanya jawab, dan format dialog lainnya
    Kami juga menawarkan korpora terjemahan.

  • Lebih dari 1 juta pasangan

    Lebih dari 1 juta pasangan

    Kami dapat menyediakan lebih dari 1 juta pasang korpus terjemahan!
    Alat dukungan terjemahan yang Anda gunakan
    Memori ini juga dapat digunakan sebagai memori terjemahan.

  • bahasa langka

    bahasa langka

    Selain data yang diterjemahkan dari bahasa Jepang ke bahasa Inggris,
    Dari bahasa Inggris ke bahasa Asia Tenggara dan bahasa langka
    Kita memegang korpus paralel yang diterjemahkan.

  • Ekspresi alami

    Ekspresi alami

    Korpus paralel ditentukan oleh penutur asli dari setiap bahasa.
    Karena diterjemahkan, bahasa ini unik untuk setiap bahasa.
    Nuansa dan klise tercermin dalam hati.

  • semi-kustom

    semi-kustom

    Selain bidang dan tipe data,
    Karena kami juga mengelola petunjuk terjemahan,
    Kami dapat mengekstrak korpus terjemahan yang Anda inginkan.
    Kami juga menawarkan pembuatan istilah teknis multibahasa.

Mendukung bidang khusus seperti ini

Pencapaian Implementasi

Divisi riset dari perusahaan telekomunikasi besar
/Institut Riset Stasiun Penyiaran
/ Perusahaan pengembangan mesin terjemahan berbasis AI
dan lainnya

Pertanyaan yang Sering Diajukan

Apa itu "korpus paralel"?
Korpus paralel adalah kumpulan kalimat yang diterjemahkan dalam kombinasi dua atau lebih bahasa, satu bahasa dan bahasa lain. Dalam pengembangan mesin terjemahan mesin berbasis AI, data yang mempertahankan konteks sebelum dan sesudah sangat dihargai. Dalam kasus satu bahasa yang kurang dari dua bahasa, ini disebut korpus satu bahasa.
Berapa banyak kata dan kombinasi yang umum dalam korpus paralel?
Kami menawarkan pilihan terluas pilihan bahasa Jepang dan Inggris. Selain itu, kami mendukung kombinasi bahasa Inggris dan Cina, Spanyol dan Prancis, serta bahasa Indonesia dan Portugis.
Jika saya membeli perusahaan paralel, apakah ada batasan penggunaan?
Ya, ada korpus paralel yang hanya dapat digunakan untuk pembelajaran mesin, dan korpus paralel yang dapat dipublikasikan di situs web atau materi edukasi. Dalam kasus terakhir, kita akan membahas istilah-istilah tersebut sebelum membeli.
Berapa unit atau harga pembelian minimum untuk korpus terjemahan?
Dikatakan bahwa sekitar 100.000 pasang diperlukan untuk pembelajaran mesin, dan pelanggan kami sering membeli di unit tersebut. Harga akan dinegosiasikan secara terpisah tergantung pada penggunaan yang dimaksud dan jumlah pembelian.
Bagaimana korpus terjemahan disampaikan?
Kami dapat mengirimkan file teks (CSV, TSV, dll.) atau file Excel atas permintaan.

Poin-poin Kunci untuk Memilih Korpus Paralel

Poin-poin Kunci untuk Memilih Korpus Paralel

Kebutuhan akan korpus dwibahasa dalam pengembangan dan penyetelan terjemahan mesin serta AI generatif multibahasa semakin meningkat. Selain itu, ketika penerjemah memulai penerjemahan di bidang baru, memiliki memori terjemahan yang terkumpul secara internal sangat meningkatkan efisiensi pekerjaan terjemahan. Di sisi lain, mengumpulkan korpus bilingual sistematis secara internal tidaklah mudah; lebih efisien untuk mencari data secara eksternal dan fokus pada pengembangan hasil yang dimaksud serta pekerjaan terjemahan.

Enam poin berikut adalah poin kunci untuk memilih korpus paralel.
1) Kombinasi Bahasa
2) Bidang
3) Kualitas
4) Jumlah
5) Jenis Data
6) Kehadiran atau ketiadaan konteks

Kombinasi bahasa pertama merujuk pada apakah pasangan bahasa yang diterjemahkan oleh penerjemah atau pasangan bahasa yang dilatih dalam pengembangan terjemahan mesin adalah Jepang dan Inggris atau Jepang dan Cina. Demikian pula, saat mendaftarkan memori terjemahan alat pendukung terjemahan yang Anda gunakan, "kombinasi bahasa" dianggap sebagai faktor terpenting. Selain itu, saat mencari ekspresi yang lebih alami, menentukan bahasa mana yang merupakan teks asli juga merupakan faktor penting. Misalnya, bahkan ketika menyebutnya sebagai "korpus paralel Jepang-Inggris," wajar untuk memperhatikan perbedaan dalam kefasihan ekspresi bahasa Inggris dan latar belakang terjemahan antara menerjemahkan sumber Jepang ke Inggris dan sumber bahasa Inggris ke Jepang.

"Bidang" dalam 2) merujuk pada bidang seperti pariwisata, kesehatan, hukum, ekonomi, ilmu pengetahuan dan teknologi, dan sebagainya. Dengan pembelajaran mesin data dari bidang yang menginginkan akurasi, pengembangan dapat dipercepat. Saat membangun model bahasa untuk meningkatkan akurasi terjemahan mesin di bidang tertentu, efektivitas diperkirakan sekitar 100.000 pasang. Sudah jelas bahwa bidang juga penting saat membuat kamus terminologi teknis dari korpus terjemahan bililing. Dalam kasus kami, bidang yang dibutuhkan di Jepang dulunya berfokus pada pariwisata masuk dengan nama negara yang berorientasi pariwisata, sementara bidang medis membutuhkan korpus dwibahasa untuk memperkuat perawatan medis bagi pengunjung masuk dan warga asing yang tinggal. Selain itu, permintaan bergeser selama beberapa tahun ke bidang bisnis yang merekam materi presentasi yang digunakan untuk presentasi bisnis dan penjelasan, kuliah di konferensi dan acara, serta sesi tanya jawab berikutnya.

Pada bagian ketiga, 'kualitas' merujuk pada akurasi, yang bergantung pada bagaimana korpus paralel dibuat. Lebih baik data diterjemahkan oleh tangan manusia, dan jika diterjemahkan menggunakan terjemahan mesin dan belum melalui inspeksi atau koreksi manusia, kualitasnya secara alami akan menurun. Selain itu, bahkan dalam data terjemahan manual, jika terjemahan satu kalimat diterjemahkan menjadi dua kalimat atau lebih, dan sangat penting bahwa teks asli dan terjemahan sesuai dengan satu kalimat, hal itu akan memengaruhi kualitasnya. Selain itu, jika terjemahan terlalu singkat, tidak dapat dianggap sebagai korpus paralel berkualitas tinggi.

"Kuantitas" pada poin 4 sudah cukup bagi penerjemah untuk mendaftarkan puluhan ribu pasangan korpus paralel di bidang tertentu untuk tujuan pendaftaran dalam memori terjemahan atau kamus kosakata alat pendukung terjemahan yang digunakan secara internal. Untuk pembelajaran mesin di bidang tertentu, seperti pengembangan mesin terjemahan mesin, dikatakan bahwa 100.000 pasangan sudah cukup efektif. Di sisi lain, mengembangkan mesin terjemahan mesin serbaguna dikatakan membutuhkan puluhan juta pasangan. Dengan demikian, jumlah korpus paralel yang dibutuhkan sangat bervariasi tergantung pada aplikasinya.

Pada bagian 5, "Tipe Data" berarti file yang digunakan untuk membuat korpus paralel adalah salah satu dari berikut ini: laporan/makalah putih, atau presentasi/konferensi pers/tanya jawab. Jika Anda ingin belajar bahasa tertulis secara mesin, gunakan laporan atau makalah putih; jika Anda ingin belajar bahasa lisan dengan mesin, gunakan korpus transkripsi yang dibuat dari presentasi, konferensi pers, dan tanya jawab. Korpus paralel kami mengelola atribut secara rinci, sehingga memungkinkan untuk mengekstrak korpus paralel berdasarkan tipe data.

"Kehadiran atau ketiadaan konteks" pada 6) berarti apakah ada hubungan semantik antara beberapa kalimat. Secara khusus, contoh kalimat yang tercantum dalam kamus hanya memuat kata utama tertentu dan tidak memiliki konteks dengan contoh lain. Oleh karena itu, dinilai sebagai "kontekstual." Sebaliknya, laporan terdiri dari beberapa kalimat yang menggambarkan suatu peristiwa atau peristiwa tertentu, sehingga dianggap "kontekstual." Demikian pula, untuk konferensi pers dan sesi tanya jawab, beberapa pembicara bergiliran berbicara, sehingga dapat dikatakan bahwa "ada konteks." Tidak terbatas pada terjemahan mesin, tetapi untuk menghasilkan jawaban yang lebih akurat dengan chatbot, kini lebih penting dari sebelumnya untuk memiliki "konteks" dalam korpus transkripsi yang dilatih oleh pembelajaran mesin.

Kesimpulan
Saat memilih perusahaan paralel, Anda perlu mempertimbangkan poin 1) hingga 6) di atas sesuai dengan tujuan penggunaan. Terutama saat melakukan pembelajaran mesin untuk bidang tertentu, sangat penting untuk mempertimbangkan kebutuhan akan kualitas, jenis data, dan konteks. Untuk menggunakan korpus paralel yang sesuai dengan tujuan Anda, silakan periksa terlebih dahulu data sampel gratis kami.

Tutup
Baca selengkapnya